日报
2026-09-22
今天最值得追的不是某个模型又快了多少,而是 AI 工作负载的控制面开始有了可部署的形状。多卡执行被收进一个版本化端点;Agent 的内存、隔离和路由不再只由应用代码临时拼接;评测也开始追问任务最终是否真的改变了环境。下面的十个发布,围绕的是同一件事:把资源、状态与结果留在系统能观测和治理的位置。
头条|多 GPU 执行终于可以像一个服务被交付
NVIDIA 将 TensorRT 11.0 的 multi-device inference 接入 Dynamo-Triton 26.07 后,调用方不必再自己管理一组 rank:一个 KIND_MODEL 实例对应一个 gRPC 模型端点,服务端创建各 rank 的执行上下文、CUDA stream 与 NCCL communicator。Cosmos 3 Nano 的案例把 44,160 个视频 token 用 Ulysses context parallelism 分到最多八张 GPU;在固定的 720p、189 帧、35 个去噪步骤下,端到端均值从单卡 156.595 秒降至八卡 34.183 秒。
数字本身不是重点。过去,分布式 rank 的生死、通信拓扑和失败处理容易外溢到客户端;现在它们可以和模型版本、资源配额一起被服务层接管。这样“多用几张卡换多少等待时间”才可能成为平台的统一决策。官方尚未给出并发吞吐、单位视频成本或 TCO,八卡结果也不是线性扩展;生产前仍应以通信拓扑、故障恢复和并发 SLO 复测。 NVIDIA 原始架构与基准,9 月 21 日,A 级
控制面从约定变为运行时能力
Agent 不该一直按峰值资源活着
AWS 的 AgentCore Runtime V2 用启动后快照缩短冷启动,并把会话内存设计成按需调入、转冷后回收。它公布的空 echo agent P75 约为 2 秒,旧运行时会随镜像从 200 MB 增长到 2 GB 而从约 5.4 秒升至近 30 秒。这里更有意思的是资源模型的转变:长时 Agent 并非普通容器的“启动—执行—退出”,而是在会话中反复经历热、冷、恢复。快照、内存回收和计费开始对齐这一生命周期,才有机会把 Agent 运行时当成独立的基础设施层。该测试排除了模型和工具调用,也混入跨区域网络延迟,因此真实依赖、状态恢复与账单仍需逐项复测。 AWS 发布与测试方法,9 月 18 日,A 级
路由器开始读取真正决定延迟的状态
SageMaker HyperPod Inference Gateway 不只按模型名分发请求:它读取 KV cache 使用率、队列深度、LoRA 驻留、prefix cache 命中率与运行请求数,再为 pod 打分。AWS 报告在特定 H100/A10G 场景中,首 token 延迟最高下降 82%。这比 round-robin 更接近推理调度器,因为连接数量并不等于 GPU 上的实际负担;cache 与 adapter locality 若不进入决策,多模型共享 GPU 的收益只能靠运气。指标陈旧、扩缩容抖动、429 回退与高基数 LoRA 仍是上线时需要亲自验证的边界。 AWS 架构与基准,9 月 18 日,A 级
隔离的单位应当与会话的权限边界一致
同一周 AWS 也给出自托管 Agent sandbox 的参考架构:每个 Agent 会话拥有独立的 Lambda MicroVM,凭据、网络边界与治理仍留在客户账户内。对于会执行代码、调用外部系统的 Agent,这比“所有会话共用一个容器进程”更符合风险的形状;身份、网络和销毁可以绑定为同一个可审计生命周期。它不是默认安全承诺,镜像供应链、出站策略、短期凭据、日志脱敏与异常回收依旧是不可省略的部署工作。 AWS 参考架构,9 月 18 日,A 级
评测要追到环境末端,而不是停在一次调用
NVIDIA 对 Agent 评测的划分很清楚:step-level score 用来找失败发生在哪一步,end-to-end outcome score 则以数据库、测试或工单等最终环境状态判断任务是否完成;成功率区间、tool-call precision、argument accuracy、成功任务步数与 cost per success 分别回答可靠性、诊断和经济性的问题。它把“准确率”这个单一代理拆开了:发布门禁看结果,调试看路径,成本核算看成功的代价。企业基准仍应优先使用真实工单与可执行验证,不能把厂商套件中的 LLM judge 分数直接搬进生产结论。 NVIDIA 评测方法,9 月 21 日,A 级
这种对状态的重视也出现在 serving 运行时。SGLang v0.5.20 同时改动了缓存和数据治理契约:统一 radix tree 为 SWA 分支保留分叉点状态;CPU-only simulator 用真实 scheduler、radix/hierarchical cache 与延迟预测器研究调度;/v1/responses 则默认不再在内存保留结果。模拟器把调度方案的筛选提前到 GPU 之前,默认不留存响应则让隐含的数据风险显式化。发布说明中“多数 trace 的 TTFT 误差约 6%”不是容量证明,升级还要检查 Responses API 的行为变化、CUDA 12 退役与移除的 prefill CP v1。 SGLang v0.5.20 发布说明,9 月 18 日,A 级
端侧 MLPerf Edge Agentic 把这个思路延伸到长轨迹:TensorRT Edge-LLM 在 Jetson AGX Thor 上的结果并非只报一个 kernel,而是完成 20 段会话、1,007 个生成 turn;96% 的 prompt token 来自跨 turn 热缓存。它提醒我们,端侧 Agent 的瓶颈常是不断累积的共享历史。6.4 倍对比涉及不同量化与运行时组合,尚未给出能耗、温升和持续频率;若要迁移到产品,仍需用真实工具延迟与自有轨迹重测。 NVIDIA 结果与 MLPerf 配置入口,9 月 16 日,A 级
科研计算把“状态如何重建”带到现场
Earth2Studio 的数据同化教程展示了另一种控制面:Score-Based Data Assimilation 在扩散去噪中用点观测约束 CorrDiff/StormCast,HealDA 则把异构遥感与地面观测投到 1° HEALPix 网格。官方案例报告 CorrDiff-COSMO 的风速 RMSE 降低 54%,StormCast-CONUS 六步平均降低 7.2%。科学机器学习进入运行系统后,问题不只是模型快不快,而是最新观测如何持续进入状态估计;模型、观测算子、数据源适配与 GPU 执行必须组成可复现实验链。具体收益会随观测密度、误差与空间分布而变,落地前仍要做留出站点验证和传统数值分析对照。 NVIDIA Earth-2 教程与实验,9 月 21 日,A 级
机器人论文 SceneLM 选择把长期场景记忆压成可编辑文本状态:2B/4B VLM 读取 RGB-D 与当前地图,只输出 ADD、EDIT、REMOVE,持久层不保留视觉 embedding 或图像裁剪。作者报告场景表示缩小 6–12 倍,并在四足机器人上完成在线实验。它的价值不只在省存储,而在于状态变得可检查、可差分、可同步;相应代价是感知误差与状态修复被集中到生成模型上。作为预印本,长时漂移、重复/误删对象、动态场景和闭环失败率仍比单次检索成绩更值得追踪。 SceneLM 论文与代码入口,9 月 18 日,A 级
把在线思考编译为离线能力
Google Research 的 Retrieve-for-Train 为今天的主线补上一块更轻的控制面:先用 RL 训练 4B 模型生成满足 groundedness、diversity 与 alignment 的查询集合,再离线合成监督数据,最后训练 53.9M 参数的扩散检索器一次生成整组 embedding。作者给出相对自回归查询扇出的 12–20 倍推理加速。可迁移的洞见不是具体倍数,而是当集合级目标稳定、数据库边界明确时,在线逐 token 的“想一想”可以被训练编译成较小模型的一次前向。专有音乐数据、奖励函数与目标库几何都限制了它的外推;索引漂移后的重训成本、跨域召回和尾延迟,才决定这种取舍是否适合企业语料。 Google Research 说明与论文入口,9 月 15 日,A 级