systems影响力 91.8

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

本文报告了在昇腾 NPU 超大规模集群上对万亿参数级 MoE 模型 DeepSeek-V4 家族进行全参数后训练的系统优化实践,实现了 34.22% 的模型算力利用率(MFU)和 2.93 倍的性能提升,并基于此构建了面向运筹优化(OR)任务的持续预训练与微调流程,最终在零样本推理任务上达到 71.81% 的 Pass

arXiv 2607.20145Dongfang Li, Xiaodong Luo, Ruoyu Sun, Xuhui Chen, Linyuan Qiu, Jian Meng

SLAI T-Rex: Full-Parameter Post-training of the DeepSeek-V4 Family on Ascend SuperPOD

一句话概括

本文报告了在昇腾 NPU 超大规模集群上对万亿参数级 MoE 模型 DeepSeek-V4 家族进行全参数后训练的系统优化实践,实现了 34.22% 的模型算力利用率(MFU)和 2.93 倍的性能提升,并基于此构建了面向运筹优化(OR)任务的持续预训练与微调流程,最终在零样本推理任务上达到 71.81% 的 Pass@1 得分,超越 GPT-5.4-Mini 等基线模型。

问题背景

随着大语言模型参数规模突破万亿,全参数后训练(包括持续预训练 CPT 和指令微调 SFT)面临严峻的系统级挑战。对于混合专家(MoE)架构的模型,分布式训练中主要存在三大痛点:显存压力巨大(需要同时容纳完整模型参数、优化器状态和激活值)、通信开销无法被计算有效掩盖(非重叠通信)、以及底层算子执行效率低下。当前主流的大规模训练系统几乎全部基于 GPU 集群构建,而本文聚焦于国产昇腾 NPU 平台,试图解决在非 GPU 生态下实现同等甚至更优训练效率的问题。此外,作者还希望将训练好的模型应用于复杂的运筹优化任务——这类任务需要模型具备数学推理和约束求解能力,对后训练数据的质量和领域适配性提出了更高要求。

方法要点

本文的核心贡献是一套分层优化框架,从三个层面解决万亿参数 MoE 模型在昇腾 SuperPOD 上的训练效率问题:

  1. 模型级并行策略:针对 MoE 架构特点,设计了结合张量并行、专家并行和数据并行的混合并行方案。特别地,通过优化专家路由的负载均衡,减少因专家分配不均导致的空闲等待时间。

  2. 计算-通信协同编排:关键创新在于将通信操作与计算过程进行精细的流水线重叠。传统方案中,AllReduce 等通信操作往往需要等待计算完成才能开始,导致 GPU 空闲。本文通过预取和异步调度,使得通信可以与后续层的计算同时进行,从而隐藏通信延迟。摘要中提到的“非重叠通信开销”正是通过这一机制得到缓解。

  3. 底层算子级优化:针对昇腾 NPU 的硬件特性,对核心算子(如 MoE 中的门控网络、专家前馈网络)进行了手工调优,包括内存访问模式优化、算子融合(将多个小算子合并为一个大算子以减少启动开销)以及使用 NPU 特有的向量指令。

在训练流程上,作者首先使用上述优化框架对 DeepSeek-V4 基础模型进行全参数后训练,然后针对运筹优化任务构建专门的 CPT 和 SFT 数据管道。数据来源包括收集的领域资源(如运筹学教材、论文、竞赛题解)以及通过求解器(如 Gurobi、CPLEX)验证的合成优化文档。最终产出的 SFT 数据集包含 10K 高质量样本,覆盖四种任务类别(如线性规划、整数规划、约束满足)和三种问题表示形式(自然语言描述、数学公式、代码)。

关键结论

  • 训练效率:在昇腾 SuperPOD 上,优化后的系统实现了 34.22% 的模型算力利用率(MFU),相比开源基线方案(摘要未给出具体基线名称)提升了 2.93 倍。训练过程保持稳定(摘要未给出具体的稳定性指标,如 loss 曲线或梯度范数)。
  • 领域模型性能:基于 DeepSeek-V4-Flash 构建的运筹优化专用模型,在零样本 Pass@1 评测中达到 71.81% 的平均得分,分别超越 GPT-5.4-Mini 和基础 DeepSeek-V4-Flash 模型 3.98 和 11.27 个百分点。摘要未给出具体评测数据集名称或任务数量。
  • 数据有效性:10K 规模的 SFT 数据即可带来显著性能提升,表明精心设计的合成数据在运筹优化这类结构化推理任务中具有高效性。摘要未给出不同数据量或数据配比的消融实验结果。

读后思考 / 适用场景

本文最值得关注的价值在于展示了国产硬件生态(昇腾 NPU)在万亿参数级模型训练上的可行性。长期以来,大模型训练几乎被 NVIDIA GPU 生态垄断,而本文用 2.93 倍的加速比证明,通过系统层级的深度优化,NPU 集群同样可以支撑顶尖模型的训练。这对于国内算力基础设施的自主可控具有重要参考意义。

从应用角度看,运筹优化是工业界(供应链、物流、排产)和学术界(组合优化、决策科学)的核心需求。传统方法依赖人工建模和求解器,而本文尝试用大模型直接生成优化方案,虽然目前仅达到 71.81% 的零样本准确率,但已经展示了“用语言模型替代部分人工建模”的潜力。对于需要快速生成可行解的轻量级场景(如实时调度建议),这种方案可能比传统求解器更实用。

此外,10K 数据量就能带来显著提升,说明运筹优化任务具有相对清晰的“规则性”,模型更容易从有限的样例中学习到模式。这为其他结构化推理任务(如代码生成、定理证明)的数据构建提供了思路。

局限与开放问题

  1. 硬件可迁移性:所有优化均针对昇腾 NPU 的特定架构(如向量指令集、内存层次),这些方法能否迁移到其他 NPU 或 GPU 平台?摘要未给出跨平台对比实验。

  2. 训练稳定性细节:虽然声称“保持训练稳定性”,但未提供 loss 曲线、梯度范数、专家负载分布等关键指标。万亿参数模型的训练极易出现 loss 尖峰或梯度爆炸,这些细节对复现至关重要。

  3. 评测基准的局限性:零样本 Pass@1 得分虽然高,但未报告多步推理(如 Chain-of-Thought)或带反馈的迭代求解性能。运筹优化中,单次答案正确往往不够,需要模型能解释推理过程或修正错误。

  4. 数据合成质量:10K 数据中,求解器验证的合成文档占比多少?合成文档是否覆盖了真实工业场景中的复杂约束(如非线性、随机性)?摘要未说明。

  5. 与 GPT-5.4-Mini 的公平对比:GPT-5.4-Mini 是通用模型,而本文模型经过领域特化,性能领先在预期之内。更有意义的对比应是同等参数量的领域特化模型(如基于其他基座微调的模型),但摘要未提供。

  6. 推理效率:本文聚焦训练优化,但部署后的推理延迟和吞吐量同样关键。对于需要实时响应的运筹优化场景,万亿参数模型的推理成本是否可接受?摘要未涉及。

本页为科普精读;细节以 arXiv 原文为准。就本篇提问请点左下角「论文研读助手」。