在最新全球超级计算机TOP500榜单中,“灵晟”国产超算荣登榜首,这一成就标志着国产算力进入全新发展阶段。与此同时,清程极智与“灵晟”团队携手完成了一项突破性技术成果——基于纯CPU架构的MoE模型分布式推理方案,成功在16个计算节点上实现DeepSeek-V3/R1-671B模型的流畅运行。当批处理规模达到2048时,其输出吞吐性能已可与配备80张主流GPU的集群相媲美,为国产算力向实际生产力转化提供了关键技术范式。
这项技术突破的核心在于超算架构与AI需求的深度融合。传统超算主要服务于科学计算领域,而“灵晟”通过原生超智融合设计,在硬件层面实现了三大创新:其自研的LX2 CPU集成矩阵加速单元,支持多精度计算,突破了传统CPU的算力边界;片上内存架构提供TB级带宽,较传统方案提升十倍,为大模型推理中的高并发数据处理奠定基础;配套的“灵启”网络支持微秒级时延传输,可扩展至200万端口和10万节点规模,有效解决了分布式推理中的通信瓶颈问题。这种从芯片到系统的全栈创新,使超算平台具备了直接服务AI大模型的能力。
硬件创新只是基础,真正的挑战在于软件生态的重构。清程极智团队针对LX2 CPU的异构特性,开发了专用算子库和并行加速框架。通过重构计算算子与通信算子,结合指令级优化和异步流水线调度技术,将MoE推理时延从1440微秒压缩至980微秒。在集群层面,团队设计了包含张量并行、流水线并行、专家并行和数据并行的四维混合策略,特别是针对DeepSeek模型的专家并行架构,实现了256路专家权重的全量分散部署,配合定制化的Attention模块并行方案,充分释放了硬件集群的算力密度。
技术突破的价值最终体现在应用效能上。该方案引入的MTP(多token预测)技术,通过单次推理生成多个候选token并并行验证,显著提升了单位请求的输出速率。经实测验证,在16节点集群上运行的DeepSeek-671B模型,其推理吞吐量与80卡GPU集群持平,而硬件成本和能耗指标更具优势。这种性能表现证明,国产超算已突破传统科学计算的边界,能够作为标准化AI生产力平台,持续稳定地输出模型token服务。
这项成果的产业意义远超技术层面。当前国产算力发展已进入深水区,行业关注点从硬件可用性转向实际服务能力。清程极智通过系统级优化,打通了从硬件峰值算力到实际AI生产力的转化链路,其构建的"算力-软件-服务"全栈能力,为国产算力量产交付提供了可复制的工程化路径。特别是在专家并行等复杂模型架构的适配上,团队摒弃了简单的移植思路,而是基于国产硬件特性进行原生优化,这种技术路线为异构算力生态建设提供了重要参考。
随着大模型技术向千亿、万亿参数规模演进,对算力基础设施提出了更高要求。此次纯CPU推理方案的成功落地,不仅验证了国产超算承载AI大模型的能力,更开创了超算资源错峰利用的新模式。当科学计算与AI推理在统一平台上协同运行,算力资源的利用率将得到质的提升。这种技术融合趋势正在重塑算力产业的价值评估体系,未来对算力平台的考核将更侧重于单位能耗的token产出、服务稳定性等实际指标,而非单纯的硬件参数比拼。












