跳到主内容

日报

2026-09-28

本期系统判断:AI Infra 的可用性能,不是芯片峰值,而是数据、编译结果和输出质量在真实运行链上能否持续被验证。 跨地域训练要处理冷缓存,GPU kernel 优化要回到完整模型校验,生产 Agent 的数字也要能在流式输出中核对。周末缺少足够新的大规模系统公告,本期以 9 月 24—25 日尚未报道的原论文、平台更新和工程发布为主;它们今天值得读,是因为提供了可复测的边界,而非假装是 9 月 28 日新发布。

头条|训练集留在原地,GPU 能否在另一地域跑满

AWS 与 Qumulo 9 月 25 日公布跨地域 SageMaker HyperPod 训练案例:数据保存在美国东部,西部训练集群通过本地 Qumulo spoke 和预测缓存读取;官方在 16 张 H100、1.02B 参数模型的对照中报告,缓存预热后远端与同地域训练均约为 115—117 samples/s。系统意义是数据不必总随稀缺 GPU 容量整份复制,但这把关键路径转交给缓存命中率与跨地域传输。**证据边界:**冷启动前约 100—150 个 batch 更慢,结果仅对应报告中的数据加载模式;随机读取、数据更新、出口费用及故障恢复仍须独立复测,不能推断跨地域训练普遍无代价。发布日期:2026-09-25;来源 B 级:AWS/Qumulo 原始架构与对照表。

模型训练|把 RL 流程封装为可观察的服务

AWS 9 月 25 日给出 SkyRL 在 SageMaker HyperPod 上的多模态后训练流程:Ray 管理作业,FSDP 策略分片与 vLLM rollout 引擎共处 GPU worker,FSx for Lustre 承载 checkpoint 与 LoRA adapter,并用 Grafana 观察训练。官方在固定 64 个视觉迷宫评测上报告解题率由 43.75% 提升到超过 95%。可迁移的系统点是长时 RL 的计算、存储、恢复和评测要闭环,而非某个模型分数。**待验证:**迷宫任务、起始 SFT checkpoint 和评测规模限制了泛化;多节点故障注入、恢复时间与资源成本尚需自身实验。来源 B 级:AWS 原始端到端教程。

Google Cloud 9 月 25 日发布 Gemini 托管 RL 微调的工程指南:用户提供 prompt 与可执行的奖励函数,平台托管候选生成、打分和更新。它把专有模型的后训练基础设施开放为“奖励接口”,使可验证结果而非单一参考答案成为训练信号。**待验证:**指南不是模型效果的独立基准;奖励投机、离线与真实用户分布偏差、训练费用及版本回退都需要具体应用验证。今天仍值得读,是因为它与 SkyRL 分别展示了自管工作流与托管服务的责任分界。发布日期:2026-09-25;来源 B 级:Google Cloud 原始 RLFT 指南。

计算基础设施|存储局部性之外还要看可治理性

Google Cloud Storage 于 9 月 25 日宣布 Storage Intelligence advisor 正式可用,并扩展批量操作:前者依据使用与元数据快照发现异常访问、跨地域流量等,后者面向海量对象执行存储级别等变更。对于训练与推理流水线,存储费用、限流和数据生命周期可成为可观察的控制面,而不只在月底账单出现。**待验证:**官方说明按日快照,异常可能延迟至次日才显示;批量变更的权限、重试和错误对象处理需要先在小范围演练,不应把“建议”视为自动正确。发布日期:2026-09-25;来源 A 级:Google Cloud 正式功能发布。

编译器与运行时|优化应保留可解释和可回退的路径

9 月 24 日预印本 Loom 将 tile 程序在数据流加速器上的映射、通信与异步流水编成符号约束,再用 CP-SAT 为候选调度求解。作者称在两代 Tenstorrent 硬件的 GEMM、Flash Attention 与 Flash Decode 上,无逐形状 profiling 即可达到或超过厂商 TTNN 库。系统意义不是“自动调优已经过时”,而是硬件显式的数据移动约束可能提供可移植、可追溯的编译决策。**待验证:**结论仅覆盖论文中的架构和算子,求解时间、动态形状与跨厂商迁移仍待复现。发布日期:2026-09-24;来源 A 级:Loom 原论文。

同日的 KernelOPT 预印本选择另一路径:保留 cuBLAS/cuDNN 调用,只让多个 profiling 引导的 Agent 搜索编译器生成的 Triton 子 kernel,并经过静态、多随机种子、模型级正确性和性能四级门禁;没有候选通过就保留编译基线。作者在 KernelBench 三个难度级别报告相对 torch.compile 的几何平均加速分别为 1.40、1.15、1.07 倍。它的工程启示是优化对象必须与完整模型 dispatch 和正确性契约相连。**待验证:**模型/设备分布、搜索算力成本、浮点容差和未覆盖的真实工作负载决定净收益。发布日期:2026-09-24;来源 A 级:KernelOPT 原论文。

评测与可靠性|流式答案也要逐段验数

AWS 9 月 25 日公开 NarrateAI 的生产质量保障复盘:按查询复杂度选择路径、跨模型与账户容量故障转移、逐段流式评测,并对数值先精确匹配、必要时再做语义核验。团队报告六个月部署中的数值准确率约 99.3%,但这只是其内部业务负载与验证定义下的结果。更一般的系统意义是质量检查可以与输出并行,而不是事后抽检。**待验证:**独立标注、样本分布、指标更新、跨账户权限以及误检/漏检率;不能把企业案例数字当作通用 Agent 安全保证。来源 B 级:AWS 原始工程复盘与方法。

科研计算与论文|科学代码数据要能执行

9 月 24 日预印本 SciWalker 用科学库接口构造 operator graph,再由 LLM 生成题目、参考解和测试,对失败样本做执行反馈修复。作者报告得到覆盖五个科学领域、32 个子领域的 8,178 个问题,并在其训练设置中把 SciCode 子问题准确率由 29.3% 提至 39.2%。这类工作把科研软件的“看起来合理”压回到可运行的工作流与测试,适合作为科学 Agent 训练数据的候选基底。**待验证:**生成测试是否能发现科学意义上的错误、领域覆盖偏差和对真实研究代码的迁移;论文仍是预印本。来源 A 级:SciWalker 论文与代码入口。

工程与开源雷达|请求可追踪,也要防止日志外溢

Xinference v3.5.0 于 9 月 25 日发布:正式说明列出可选请求日志、actor 调用间的关联元数据、请求来源标识、受保护的日志访问,以及 embedding/rerank 的原生 vLLM batching。相比单纯加模型适配,这些是多模型服务的可观测性与资源利用能力。**待验证:**启用前需检查日志的内容范围、访问控制、保留周期和高并发写入成本;发布说明没有给出跨负载吞吐保证。来源 A 级:Xinference v3.5.0 正式说明。

检索覆盖近 72 小时并延伸至 14 天窗口;对照最近 30 天现有日报,以链接、论文 ID、版本和底层事件去重。MoE/EFA 训练架构、TRE 跨模型伸缩、vLLM v0.30.0 及 Google 跨地域推理路由等 4 个已报道线索被跳过。本期 9 项为独立一手事件,来源 A 级 5 项、B 级 4 项、C 级 0 项;能源/散热方向未找到适合在今日作为独立一手事件发布的新材料。所有厂商性能数字仅代表其公布的测试配置,编辑判断不等于复现结论。