华为今日宣布,正式开源其基于昇腾NPU训练的盘古MoE模型openPangu-2.0-Pro。这款模型作为openPangu-2.0系列的最新成员,拥有5050亿的总参数规模,其中激活参数为180亿,支持长达512K的上下文长度,训练数据总量达到约34T tokens。此前,华为已在6月12日开源了该系列的轻量化模型openPangu-2.0-Flash,其参数规模为92亿,激活参数为6亿。
openPangu-2.0-Pro在模型架构上进行了全面升级。其Attention架构采用高效MLA,并引入DSA+SWA独立分层混合架构,层配比为1:2。SWA层负责局部窗口建模,而DSA层则负责稀疏全局聚合,这种设计在保持精度的同时,显著降低了长序列推理的计算、显存与访存开销。拓扑架构方面,传统残差连接被升级为4支流mHC架构,提升了表征多样性与泛化能力。自投机模块采用3头MTP架构,能够一次额外预测3个token,从而提升了模型的推理速度。训练中还采用了Muon优化器,以获得更快的收敛速度。
研究还发现了一套正向协同反馈机制,即底层性能强劲的基础推理能力能够直接支撑复杂智能体行为的运行,而智能体的持续运行又会反向迭代优化模型的多阶任务规划能力与长轨迹上下文处理水平。这一发现为模型性能的进一步提升提供了新的思路。
openPangu-2.0系列模型是专为长上下文智能体任务打造的。智能体应用要求模型能够执行长程任务、精准调用外部工具,并在长时间运行时保持认知一致性。然而,现有通用框架在部署时存在不少问题,如不必要的推理资源损耗、长上下文长度拖累模型表现等。为此,华为融合自研硬件内核、整机系统架构、训推一体化智能体强化学习算法,并搭配专属推理加速方案,搭建了一套完备的软硬件协同设计体系。
在性能评估方面,技术报告虽未公开openPangu-2.0与第三方模型的对比结果,但提到该系列模型在通用能力测试、推理任务、智能体等测试中表现出色。不过,在处理复杂现实世界软件工程任务时,仍与顶尖模型存在明显差距。具体而言,openPangu-2.0-Flash和openPangu-2.0-Pro在多种通用测试中都表现优异,包括上下文学习、指令遵循以及多轮理解能力等方面。在世界知识及事实可靠性测试中,openPangu-2.0-Pro的表现更是远超openPangu-2.0-Flash。
在模型架构的核心部分,openPangu-2.0系列采用了分层混合注意力机制,将滑动窗口注意力机制(SWA)用于稠密局部上下文的处理,将深度稀疏注意力机制用于全局稀疏信息检索。同时,为实现推理加速,模型还额外搭载了一个三头多Token预测(MTP)模块,并将流形约束超连接(mHC)与Muon优化器相结合,以在固定数据投入量的前提下提升模型收敛速度。
训练基础设施方面,华为搭建了一套系统化协同优化框架,以应对模型拓展至512K上下文窗口时带来的更高通信开销与显存占用瓶颈。该框架融合了无冗余混合上下文并行(CP)、面向MTP的轻量化点对点数据传输、适配Muon优化器的分布式计算通信重叠机制以及混合重计算策略。还依托Ascend C专用编程语言定制融合内核,对mHC、参数化注意力汇点(PAS)、模块化注意力(ModAttn)模块进行深度加速。
预训练阶段,openPangu-2.0的预训练语料库包含约34T tokens,预训练过程被划分为三个阶段,每个阶段都采用特定的数据配方和选择策略来逐步提升模型的能力。后训练阶段则分为三级流水线,包括监督微调(SFT)、并行强化学习专家训练、多专家在线策略蒸馏(OPD)。
在推理加速方面,华为自研了昇腾原生推理框架,实现硬件执行逻辑与模型运行时动态行为耦合。该框架自研多款融合算子,包含面向推理场景优化的mHC算子、专用集合通信原语,同时配套Felix上下文并行、单核多流执行等并行策略。在128K上下文长度下,这套框架在昇腾NPU硬件的长上下文推理性能表现出色。










