日报
2026-09-30
本期系统判断:AI Infra 的有效吞吐正越来越受资源如何分配、何时占用和怎样复现所限制。 固定电力预算下重分配 GPU 功率可以增加集群总产出,但尾延迟可能变差;MoE 通信与 KV 缓存也只有在拓扑、工作集和访问时机匹配时才兑现收益。9 月 27—29 日的系统论文与厂商实测共同指向这条边界。
头条|同一电力预算能承载更多 GPU,但尾延迟上升
NVIDIA 与 Nscale 9 月 27 日发布 DSX MaxLPS 测试:在相同 264.4 kW 配电预算下,GB300 NVL72 集群从静态配置的 140 张 GPU 增至 192 张,Kimi K2.5 混合推理工作负载的聚合吞吐提高 49.2%,每瓦吞吐也提高 49.2%。这是通过在设备之间动态分配已有功率余量实现的,并非增加供电。对 AI 工厂来说,功率策略开始影响可部署容量和调度结果。**待验证:**这组联合测试来自特定模型、硬件、四机架和负载组合;中位数与 P75 延迟在基线 5% 内,但 P99 首 token 延迟上升 17%。不同功率曲线、散热、遥测误差和限额策略均须按现场验证。发布日期:2026-09-27;来源 A 级:NVIDIA 原始测试与指标表。
模型与系统|MoE 调度要同时看拓扑和负载
TopoEP 预印本把专家负载均衡从 CPU 规划移到 GPU:每层、每个微批根据路由结果执行热门专家复制与 token 重路由,并按先跨节点、后节点内的顺序生成拓扑感知方案。作者将其集成到 Megatron-LM,在 32 张 H800 和三个 MoE 模型上报告端到端训练吞吐提高 6.2%—11.4%。意义在于路由负载和通信层级共同决定同步关键路径,逐层调度本身也必须足够轻。**待验证:**结果来自单一集群和论文指定模型;不同网络拓扑、专家路由分布及复制带来的显存占用需复测。发布日期:2026-09-28;今天值得读,因为它提供了独立于云厂商 MoE 案例的 GPU 原生训练调度方案。来源 A 级:TopoEP 原论文。
计算基础设施|PCIe 集群的 all-to-all 值得单独优化
VarioPath 面向没有 NVLink 或 Infinity Fabric 的 PCIe GPU 集群,为 AlltoAllv 建立离线拓扑通道目录,再由在线调度器按实时、偏斜的通信需求组合传输。作者在最多 256 张 GPU 的四个平台上报告,相对 FAST 的平均 AlltoAllv 加速为 5.88 倍、相对 DeepEP 为 1.72 倍;端到端测试中的 Qwen3 推理延迟最高下降 27.2%,Wan2.1 生成延迟下降 6.1%。这提示成本优化型 PCIe 集群的 MoE 与多模态负载不能直接套用 NVLink 集群的通信假设。**待验证:**对比基线、GPU 组合、消息大小与流量偏斜都影响收益;具体软件栈的调度开销和部署兼容性尚待独立复现。发布日期:2026-09-28;今天值得读,因为它把规模化推理的通信路径扩展到更广泛的 PCIe 硬件。来源 A 级:VarioPath 原论文。
推理缓存|缓存命中之后还要及时把数据放进快层
TempoKV 研究 SSD 支撑的 CXL 内存层级:KV 前缀命中可以提前获知,但过早把数据占进受保护的快层会挤占空间,等到请求真正取用才加载又可能暴露 SSD 延迟。系统因此把“知道将复用”与“提交快层容量”分开,按预计取用时间和加载所需时间决定何时驻留。作者在 vLLM、LMCache 和 SSD-backed CXL 设备上,以两种模型和三种前缀命中率测试,报告相对立即预取减少 63%—91% 的受保护快层字节时间;与未修改的 LMCache Device-DAX 配置相比,P95 TTFT 最多降低 48%。**待验证:**测试规模与设备有限;驱逐行为、并发负载、SSD 写入寿命和缓存命中分布会改变收益。发布日期:2026-09-28;今天值得读,因为它细化了远端 KV 缓存从“能命中”到“能及时使用”的资源承诺问题。来源 A 级:TempoKV 原论文。
EfficientAgent 解释了为何 Agent 的 KV offload 在一些部署中省时、另一些却变慢:运行中的其他会话会在工具等待期间持续占用主机内存,因此缓存层容量必须容纳整个 Agent 池的复用工作集。作者用历史轨迹估算该工作集,再决定何时停止写入容易被淘汰的大块上下文。在 SWE-bench Verified Agent 测试中,按估算工作集配置主机层,重算 prompt token 减少 93%,端到端耗时减少 39%。**待验证:**这是指定代码 Agent、模型和三类 GPU 的结果;工具等待、并发用户数及会话长度变化会改变工作集。该预印本 2026-09-27 提交,今天值得读,因为它说明增加主机内存容量的收益存在明确拐点。来源 A 级:EfficientAgent 原论文与代码入口。
科研计算与论文|正确性、运行速度和环境操作都要验证
GPUPhysBench 将 GPU 物理仿真纳入编码 Agent 评测,包含流体、可变形固体与颗粒材料的 50 项任务,要求系统在固定时间预算中编译、测试并优化实际 GPU 代码。作者评估六组模型与 harness:最强组合通过全部 50 项,但在至少 90% 专家参考实现速度上,仅有 22% 的任务达到要求;没有方案快过参考实现 5% 以上。这让科研代码 Agent 的正确数值结果与硬件效率成为并列门槛。**待验证:**单次提交和任务集不代表所有 GPU 物理领域;数值误差容忍度、更多硬件、重复运行及参考实现质量仍需扩展。发布日期:2026-09-28;来源 A 级:GPUPhysBench 原论文。
ASCEND 预印本在研究者自有笔记本上运行 Agent,通过经认证的连接访问 Slurm 集群与 GPU 工作站,并把站点策略检查放在本地工具,不向模型提供集群凭据。作者展示的案例包括恢复人为注入的张量设备故障、复现天气模型评测、并行化地球物理求解器,以及发现公开代码中的未定义行为。其系统意义是科研 Agent 可以跨越本地交互与远端 HPC 作业,但访问策略和作业工件需要保持在机构控制边界内。**待验证:**作者明确说明这些演示有人监督,端到端恢复基准仍未完成;策略检查在构造的违规请求中拒绝 29/30 项,同时也拒绝了 14 项合法请求中的 3 项。预印本发布日期:2026-09-26;今天仍值得读,因为它具体暴露了 HPC Agent 的凭据边界和作业恢复问题。来源 A 级:ASCEND 论文与安装器。
AlphaFold2 云 TPU 研究用同一 JAX 工作负载对比 CPU、T4 GPU 与八芯片 TPU v5e slice,发现软件映射会左右硬件收益:默认路径只用一个 TPU 芯片,vmap 批处理没有提高单查询吞吐,而 pmap 将查询映射至多芯片后,在论文指定网格上达到单芯片吞吐的 6.5—7.9 倍。作者同时报告约四分之三的新输入形状首次运行耗时来自 JAX tracing/compilation;五周后复测无法重现两个云端基线,其中 GPU 结果约差两倍。**待验证:**作者自己的复测已显示云端环境会改变基准结论;因此绝对时长和 TPU/GPU 比值不能外推,必须固定软件、区域、形状和成本口径。发布日期:2026-09-28;今天值得读,因为它把编译、并行映射和复测漂移纳入加速器选型证据。来源 A 级:AlphaFold2 TPU 原论文与代码数据。
工程采用|多模态索引与在线检索分开扩缩
AWS 9 月 29 日公布 Condé Nast 的多模态视频发现方案:以异步流程对超过 14 万段视频生成跨画面、音轨和转录文本的向量,另设查询服务用 OpenSearch k-NN 返回片段时间戳;两条路径可独立扩缩,并跨可用区部署。客户工作坊测得单次内容发现从约 250 分钟降至 2 分钟以内,方案已运行六个月。它展示了多模态媒体检索如何把批量编码和交互搜索解耦。**待验证:**耗时来自客户 2026 年 5 月工作坊,不是通用服务基准;召回质量、回填成本、向量索引成本及不同视频切片策略仍需按语料评估。发布日期:2026-09-29;来源 B 级:AWS 原始架构与客户测量。
检索覆盖近 72 小时,并查阅 14 天内新提交的分布式系统、机器学习与科研计算原论文;对照最近 30 天日报,按论文 ID、正式版本和底层事件去重。MoE/EFA rollout、TRE、SkyRL、SGLang v0.5.20、vLLM v0.30.0 等 5 个已报道线索跳过。本期 9 项独立一手事件,A 级 8 项、B 级 1 项、C 级 0 项。厂商和论文性能数字均限于来源列明的测试环境,不能直接作为跨集群承诺。