日报
2026-09-27
本期的系统判断是:GPU 是否够用,越来越取决于控制面能否看见真实负载、网络拓扑和失败边界。 跨模型服务需要在固定预算内调配容量;MoE 强化学习把稀疏通信推到跨节点网络;集群“健康”也必须由真实分布式作业证明。以下九个独立信号均回到论文、原始工程报告或正式版本说明。9 月 21—23 日的内容是近期补充,今天仍值得读,是因为它们与本周的容量仲裁、集群验证和版本升级共同构成一条可落地的运维链,而不是把旧发布写成今日新闻。
头条|MoE 强化学习的瓶颈进入跨节点通信
AWS 9 月 25 日公布 EKS、EFA 与 DeepEP 的 MoE 强化学习架构:把 DeepEP 的稀疏专家 dispatch/combine 接到 libfabric/EFA,节点内仍走 NVLink。其内部测试在 48 台 P5en(16 台训练、32 台推理)的特定超稀疏 MoE 工作负载上,报告聚合 rollout 吞吐提高 40%。系统意义是 rollout 的弹性与策略训练的紧耦合可以分开配置,专家并行的通信路径也不能再当作通用 all-to-all 的附注。**证据边界:**对比双方除 DeepEP/EFA 外还使用不同 CUDA、PyTorch、NCCL、SGLang 和训练栈版本,不能把 40% 单独归因于一个组件;跨模型、端到端迭代时间和成本仍需同栈复测。发布日期:2026-09-25;来源 A 级:AWS 原始架构与测试配置。
模型与系统|容量必须跨模型、跨地域仲裁
固定 GPU 预算下的跨模型伸缩
9 月 24 日预印本 TRE 提出 Token Service Share:用按需求归一的 token 服务能力比较不同模型的压力,再在固定 GPU 池里执行有界的 donor/receiver 副本转移。作者在同一热切换运行时的七组服务轨迹上,报告相对 KV-cache 反应式伸缩器的 P95 延迟下降 11.9%—79.0%。这把伸缩从“每个模型各自加机器”改为共享池内的容量仲裁。**待验证:**收益来自作者的 Kubernetes 热切换栈;冷启动、权重切换成本、突发流量和跨租户公平性需要在其他服务栈复现,不可把论文区间当作生产承诺。发布日期:2026-09-24;来源 A 级:TRE 论文与代码入口。
地域路由也要读懂 KV cache
近期补充:Google Cloud 9 月 21 日发布多集群 GKE Inference Gateway 工程测试,使用推理引擎暴露的 KV-cache 利用率决定跨区域溢流,并让区域内 llm-d 继续做局部路由。官方报告在其三地域测试中,Gateway 相对本地直接调用保留 99.5% 吞吐,三个集群的请求吞吐由 0.72 增至 2.10 req/s。今天仍值得读,因为它与 TRE 分别回答了“跨地域”和“跨模型”两层容量分配。**待验证:**测试的模型、请求分布、跨洲网络和 17,000 节点背景不等于任意业务的尾延迟;需复测故障切换、数据驻留与跨区域费用。来源 B 级:Google Cloud 原始工程案例与测量表。
计算基础设施|把拓扑和就绪性变成调度输入
拓扑不能只存于人工配置
近期补充:NVIDIA 9 月 22 日发布开源 Topograph 的部署说明。它从云 API 或本地网络系统发现拓扑,再输出 Kubernetes 节点标签、Slurm 配置或 Slinky ConfigMap,让调度器看到机架、交换网络和加速器域的邻近关系。今天仍值得读,因为 MoE 的跨节点通信收益以正确放置为前提。**待验证:**提供拓扑数据不等于自动获得吞吐提升;不同 provider、动态变更延迟和调度器策略需要在真实集群测量。来源 A 级:NVIDIA Topograph 原始设计与支持矩阵。
“节点健康”不等于分布式作业可用
NVIDIA 9 月 23 日介绍开源 Cluster Readiness Engine:用 Certification、Workflow、Job 资源在拓扑分组上运行 NCCL、诊断或训练负载,失败后可分组重试以缩小可疑节点集合。它把 GPU 集群验收从静态心跳推进到作业级证据,为训练前门禁提供可审计对象。**待验证:**阈值并不随产品默认给出;误报、测试占用、跨机架故障定位和实际生产负载相关性仍须由运营方标定。发布日期:2026-09-23;来源 A 级:NVIDIA NVCRE 原始设计。
主机配置也需要渐进发布
NVIDIA 9 月 23 日公布 NodeWright:通过 Kubernetes 资源声明宿主机包和变更策略,按 cordon、drain、应用、验证、uncordon 的顺序滚动更新 GPU 节点,并可设置批次与失败阈值。它处理的是 GPU/网络 Operator 下方的主机 OS 层,不应和 NVCRE 的作业验收算作同一事件。**待验证:**长时训练作业的不可中断标签、PodDisruptionBudget、回滚路径和驱动/RDMA 组合必须先在小批量节点演练。发布日期:2026-09-23;来源 A 级:NVIDIA NodeWright 原始发布。
科研计算与论文|生物模型训练的吞吐是组合结果
NVIDIA 9 月 24 日公开 BioNeMo MoE 训练配方:Transformer Engine 的 GroupedLinear 汇集专家 GEMM,MXFP8 降低数据精度,Sequential API 将专家 MLP 的若干操作融合。官方在八张 B200 的 Mixtral-8x7B 训练配置中,报告最高为其 Hugging Face BF16/FSDP 基线的 2.21 倍。对长序列生物基础模型而言,这提示精度、路由和 kernel launch 应一起设计;但这只是计算配方的系统基准,不是生物任务质量提升的证据。**待验证:**收敛、数值误差、不同专家负载及非 Blackwell 平台的收益。发布日期:2026-09-24;来源 A 级:NVIDIA 原始配方与基准。
工程与开源雷达|运行验证与升级契约
SWE-Serve 9 月 22 日预印本把 53 个源于 SGLang 变更的任务做成可执行评测,其中 19 个带端到端服务检查;作者报告这些任务的补丁通过率在包含服务检查时为 45.9%,移除该检查则为 69.4%。今天仍值得读,因为单元测试合格仍可能无法加载模型或通过公开 API 正确服务;Agent 改动推理引擎时,发布门禁必须触及活服务。**待验证:**首版仅覆盖 SGLang、CPU 或单张 H100,不证明多卡、多节点或其他引擎上的代理能力;分数也不等于可合并性。来源 A 级:SWE-Serve 论文。
vLLM v0.30.0 于 9 月 22 日发布,正式说明列出持久化的逐 GPU 权重缓存守护进程与 --load-format ipc_cache,用于引擎重启时复用已量化、已切分权重;同时新增多种模型/硬件支持,并将普通 vllm serve 的 scale-out 端点改为显式开启。今天仍值得读,因为版本升级不仅影响冷启动,也改变服务暴露面和兼容契约。**待验证:**缓存守护进程的显存成本、重启场景收益、依赖版本和旧参数兼容性应按实际模型及平台验收;发布说明不是跨环境性能保证。来源 A 级:vLLM v0.30.0 正式发布说明。
检索边界
检索优先覆盖 9 月 24—27 日,并向前扩至 14 天的论文、系统、基准和工程发布;对照最近 30 天可用日报的 canonical URL、论文 ID、版本和底层事件。SGLang v0.5.20、TensorRT 多设备服务与 Agent 评测方法等 3 个已报道线索被去重跳过。本文九项均为独立一手事件:A 级 8 项、B 级 1 项、C 级 0 项;所有性能数字均保留原作者的测试边界,不作跨系统因果推断。本期未找到足够可核验且未重复的独立能源/散热事件,因此该方向暂缺,不以旧材料填充。