扫码分享到微信
【赛迪网讯】过去两年,AI 算力叙事的关键词一直是"芯片"——谁的单卡 FLOPS 更高、谁的显存更大。但当大模型参数量以百倍级扩张,MoE 稀疏架构、Agentic 智能体应用快速兴起,训练向万亿参数演进、推理进入超长上下文、海量 Token、多模态协同的新阶段时,一个更本质的问题浮出水面:把一堆高性能芯片用传统以太网 RoCE 组网堆叠成集群,往往跑不满、也扩不动。
瓶颈不在算力本身,而在算、网、存三者协同。跨节点通信时延高形成"通信墙",显存与内存割裂形成"内存墙",集群调度粗放导致算力利用率(MFU)长期受限。这三重墙叠加,让新一代芯片的全部能力被层层稀释。于是"超节点"(SuperPod)从技术概念走向产业共识——它通过专用高速总线把多台物理节点整合成一台"逻辑大计算机",被普遍视为大规模训推任务的最优解,也是 AI 计算与高端通用计算的关键技术方向。
而超节点要真正落地,缺的不只是芯片,而是能把芯片原生能力转化为可交付整机的系统工程伙伴。这正是 9 月 17 日 2026 华为全连接大会上,神州鲲泰发布新一代产品矩阵的产业分量所在:伴随鲲鹏 950、昇腾 950DT 原生具备超节点硬件能力,以神州鲲泰为代表的整机伙伴,正把超节点从"概念"推进到"可选型产品"阶段。
双路并进:一张覆盖通算与智算的产品矩阵

此次首批发布的新品包括基于鲲鹏 950 的 KunTai R722 K3 均衡型服务器,基于昇腾 950DT 的 KunTai A989 I5 标准服务器、KunTai A989 I5 风冷超节点,以及 KunTai PoD2000 A5 液冷超节点,全面覆盖通用计算、大模型训练、高性能推理等多元场景。神州鲲泰产品专家孙亚楠接受赛迪网采访时,将其概括为"通用算力 + AI 算力双轮驱动":数字化转型同时需要核心业务的通用底座和大模型的智算底座,客户既可单独采购,也可组合部署,获得一套完整的算力底座方案。
通用侧的 KunTai R722 K3 搭载鲲鹏 950 处理器,靠重构内核微架构实现场景化调优——整机性能提升 1.4 倍、业务性能提升 35%、支持 SVE2 并优化 INT8 矩阵向量吞吐;内存带宽提升 2.25 倍、核访比达 1:3.6,并首发灵衢接口,为大带宽、低时延的通算超节点组网打通创新路径。值得关注的是它的"内功":业界首款 3D 封装处理器让 Die 间"零距离通信",配合 CPU 故障隔离修复、内存 Cache Line 冗余修复,以及支持满带宽内存加密与 CCA 机密计算架构,把可靠性与安全能力一起做了加固。在孙亚楠看来,这类产品真正的价值在于让多台物理节点经灵衢 UnifiedBus 组网后,实现跨节点内存与 IO 资源池化、百纳秒级访问时延,从而支撑金融、运营商、政务的核心数据库与交易系统迁移,乃至承接小型机业务的平滑替换。
智算侧三款昇腾 950DT 整机则形成清晰分层。KunTai PoD2000 A5 液冷超节点面向万亿级大模型训推,主打"四个业界之最":最大 1024 卡集群、256TB 内存统一编址、MFU 可达约 45%(较前代提升 30%),并通过低温混流装甲冷板、柜级正交架构、星云 8000 LPO 光互联、2+2 光路保护等软硬件协同创新,把功耗、散热、互联、供电全方位优化,实现千卡 MTBF 高达 300 小时。KunTai A989 I5 风冷超节点单节点支持 8 颗 NPU、最大提供 14.2 PFLOPS@mxFP4 算力、整框 NPU 互联总带宽达 13.4 TB/s,推理吞吐可达前代 A3 节点的 1.5–2.0 倍,并实现业界唯一的 5ms 极致时延,适配 Agent 多智能体协同。KunTai A989 I5 标准服务器则以业界唯一的 16 卡 Full-mesh 全互联组网见长,NPU 之间无转发直连,模块化按需扩容,服务小集群推理与中型模型微调。
三款产品的取舍逻辑,孙亚楠讲得很直白:液冷整机柜追求极限算力密度、适合新建大型智算中心与万亿 MoE 预训练,但对机房改造要求高;风冷超节点完整保留超节点三大核心能力,牺牲单机柜极限密度换取存量机房兼容,无需改造液冷管路即可直接利旧传统风冷机房;标准服务器则用于轻量化部署。三者互补,正好覆盖从新建超大智算中心到存量政企机房的全谱系。
判断力:什么才算"真超节点"
当"超节点"成为行业热词,宣传与堆砌也随之而来。孙亚楠给出的评判标尺,其实是这篇文章最值得记住的一点——真正的超节点须同时满足三条硬性标准:一是专用高速硬件总线互联(如灵衢 UnifiedBus),区别于以太网 RoCE 的消息通信,减少协议转换与数据拷贝的时延开销;二是全域内存统一编址,支持以内存语义 Load/Store 直接访问远端内存而无需数据拷贝,这是与普通集群最本质的差异;三是端到端全栈软硬件协同,芯片、互联硬件、CCU、驱动、操作系统、通信库完整适配。"仅用以太网组网,哪怕硬件规格再高,也只是服务器堆叠,无法突破内存墙与通信瓶颈。"
孙亚楠还特别点出一个容易被忽视的产业真相:国产超节点不是芯片的简单堆叠,而是一项考验硬件、散热、驱动、软件栈全栈协同的系统工程,FP4 这类低精度能力也不能只靠芯片——昇腾 950DT 内置 FP4 计算单元只是基础,必须由整机在硬件链路、驱动、CANN 软件栈上全链路打通,上层业务才真正调得动 MXFP4/MXFP8,收益才兑现得了。这恰恰解释了生态整机伙伴在国产算力链条中不可替代的位置:华为输出芯片与底层能力,神州鲲泰把客户验证中发现的互联、散热、适配问题反馈迭代。产业尚在早期,规模化商用还需要芯片、整机、操作系统、数据库、AI 框架厂商持续协同打磨。
从通用计算到 AI 大模型训推,从液冷大规模超节点到企业风冷方案,神州鲲泰以鲲鹏 + 昇腾 950 双技术路线,构建起通算与智算深度融合的完整矩阵。它释放的信号很清晰:国产算力底座的竞争,已经进入"以系统工程论英雄"的新周期。(文/徐培炎)
京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司