扫码分享到微信
【赛迪网讯】过去三年,AI 算力的产业叙事几乎都围绕一个"卡"字展开——更多的高端加速芯片、更大的单芯片算力、更快的先进制程。但当大模型参数从千亿迈向 10T 乃至几十万亿,当 AI 从"回答一个问题"走向"自主完成一项任务",一个被反复验证的事实正在浮出水面:单纯堆卡的时代正在收尾,系统级的互联与通信能力,正在取代单芯片算力,成为决定计算系统性能的新胜负手。
一个足够反直觉的数据可以说明问题:在传统计算架构下,集群规模扩大时,资源利用率反而下降,十万卡集群的实际模型算力利用率仅约 20%。这意味着海量算力并非在"计算",而是在"等待通信完成"。当行业还在为"有没有卡"焦虑时,真正的瓶颈已经悄然转移——变成了卡与卡、卡与内存、节点与节点之间"连得快不快、连得顺不顺"。Agentic AI 的爆发,把这道题推到了台前。

华为常务董事、ICT BG CEO 杨超斌
这正是理解华为在本届全联接大会上重推"灵衢互联"的钥匙。2026 年 9 月 17 日,在华为全联接大会 2026 期间,华为常务董事、ICT BG CEO 杨超斌围绕计算架构创新,系统阐释了灵衢互联架构,并宣布推出基于该架构的系列化算力底座。这不是一次单点产品发布,而是对"Agentic AI 时代的计算系统究竟该怎么搭"给出的一套系统性回答。
拐点:为什么"互联"取代"算力"成为新瓶颈
要理解灵衢的价值,先要理解 Agentic AI 对底层计算提出了什么新的要求。
传统生成式 AI 的交互相对"低频"——用户提问、模型生成、一次前向传播。而 Agent 需要自主规划、调用工具、多轮执行任务,与模型的交互每小时可达数百次,这带来两个直接后果:其一,CPU 与 NPU 的算力需要被灵活配置、频繁协同,而不是各自为战;其二,多轮长上下文产生的 KV Cache(推理时缓存的历史键值,用以避免重复计算)远超单机的内存容量,必须依靠跨系统、跨层级的存储来承载。
与此同时,训练侧的压力同样在向"互联"而非"算力"倾斜。10T 参数大模型的训练需要搬运海量中间数据,单张显卡的内存容量早已难以承载;模型参数继续向几十万亿演进时,"把更多卡连成一台机器"的能力,比"把每一张卡做得更快"更为关键。
两条线索交汇,指向同一个结论:集群内不同部件之间的互联与通信能力,已经成为决定计算系统性能的关键。谁能在这一层建立优势,谁就握住了算力竞争下半场的入场券。灵衢互联,正是华为对这一判断落下的重子。
四大特征:把互联做成计算系统的"统一语言"
华为给出的、基于灵衢的计算系统具备四个特征,其共同逻辑是"用统一的互联协议,把散落的算力、内存与存储重新组织成一台可以灵活调配的大机器"。
其一,协议归一,内存语义。 传统系统内部并存着十余种互联协议,彼此割裂、转换损耗大。灵衢将其统一为一套协议,互联带宽从百 GB 级提升至 TB 级,RTT 通信时延从 7 微秒压缩到 2 微秒,并支持超节点内全局内存统一编址。本质上,这是让"访问远端内存"趋近于"访问本地内存",把跨芯片的数据搬运成本压到极低。
其二,多样算力,异构协同。 CPU、NPU、内存、SSD 等通过灵衢直接互联,实现去中心化的平等访问,CPU 与 NPU 资源可按需灵活配比。更值得关注的是工程细节:通过分层分级的 Transformer 硬加速,把 Attention(负责捕捉上下文关联)与 FFN(负责逐层特征变换)解耦,实现 AF 分离部署。其价值在于——两类核心计算模块可以分别部署到不同算力单元,按业务需要配比资源,尤其契合 Agentic AI 中 CPU 与 NPU 频繁协同的场景,从而同时提升推理效率与资源利用率。
其三,分级存储,全局池化。 以混合介质资源池化解决激活值缓存问题,把 DDR 作为 NPU 的"第二内存":既降低搜推广业务时延,让千亿级、数千维向量检索性能翻番;又降低 10T 大模型训练对单卡 HBM 的容量依赖,助力提升整个集群的模型算力利用率。这是对"内存墙"最务实的一击——不是造更大的单卡显存,而是让显存不再成为单卡的事。
其四,光电互联,灵活组网。 构建全局超高带宽、超低时延的"数据高速公路",让大小算力可以灵活扩展。这一特征是前面三点能够真正落地的物理底座。
四个特征合起来,指向一个产业信号:计算架构的竞争力,正在从"单点芯片参数"转向"系统级协同效率"。灵衢所做的,是把互联从"配件"提升为架构设计的"第一性原理"。
分层分级:从一根铜缆到百万卡集群的工程落地
理念之外,本次发布更有分量的部分,是华为把灵衢做成了一套覆盖柜内、跨柜与集群三级互联的分层分级设备,支持从单柜到百万卡集群的弹性扩展。
在柜内,灵衢互联刀片实现零电缆、零电路损耗——一个 4096 超节点即可节省 196 公里铜缆。铜缆的减少不只是成本问题,更意味着更低的损耗、更高的可靠性和更简洁的工程结构。在跨柜层面,灵衢互联设备支持 176 个端口、每端口达 1.6T、单机 280T 全光互联,RTT 时延低至 2 微秒,是业界互联带宽最大、端口数最多的高速总线协议互联设备。而在集群层面,UBG 灵衢网络交换机具备高达 1024 的超大 Radix 扇出能力,可支撑百万卡超节点集群,满足模型参数向几十万亿演进的需求。
三级设备串起来,构成了一条从"单台机器内部"到"跨机柜"再到"跨整个集群"的完整互联通路。会上同步发布的、基于灵衢的 Agentic AI 超节点集群,正是这条通路的集大成者——由鲲鹏 950、昇腾 960 超节点、OceanStor M900 记忆存储及星河 UBG 交换机组成,实现多样算力协同与分级资源池化。
值得强调的是"弹性"二字。从单柜起步、平滑扩展到百万卡,意味着客户不必在"规模"与"利用率"之间二选一:小可精打细算,大可充分释放,这恰恰回应了引言中"集群越大、利用率越低"的行业痛点。
不止超节点:让新一代互联"向下走"
真正决定一项架构能走多远的,往往不是它的天花板,而是它的可及性。灵衢互联的另一个看点,是它没有停留在服务头部玩家的超节点上,而是同步"下沉"。
华为基于灵衢架构打造了从 1 卡到 8 卡的系列化一体机及鲲鹏、昇腾算力模组。其中 Atlas 650E 风冷服务器依托双机灵衢直连技术,实现 16 个 NPU 免交换互联,双机协同如同单体设备般高效运转,支持平滑扩容,可快速搭建轻量化小型超节点。这一突破的核心意义在于:本地部署万亿参数大模型,不再是超大规模集群的专属能力,除头部大型企业外,更多行业企业、机构均可落地这套高端架构,实现高效本地化AI部署。
这套可上可下的架构体系,既能支撑百万卡顶级超算集群的极致算力需求,也能适配轻量化双机超节点的落地场景,充分印证了灵衢互联架构的成熟度与通用性,可全方位适配不同规模、不同场景的AI算力建设需求,适配全产业AI迭代升级。
底座之外,靠"伙伴+华为"把路走宽
再好的算力底座,也要有人在上面"跑起来"。杨超斌在会上把昇腾"伙伴+华为"体系的持续构建,落到了具体的协同动作上:昇腾与 DeepSeek Harness、OpenCode、openJiuwen 等开源框架协同,打造智能管理、推理加速、安全框架等 Agent 插件化组件并全量开源;已联合 50 多家客户、伙伴及高校打造 26 个行业算子库,并与 90 多家主流开源社区合作,帮助伙伴更快速地完成行业 Agent 开发与 IT 系统对接。
这条路径的逻辑清晰:底层架构解决"算得快不快",而开放的组件、算子库与开源协同解决"用不用得起来"。只有二者合流,灵衢才能真正从一次发布,沉淀为可被千行百业反复调用的能力。
赛迪观察:系统级创新,才是下半场的护城河
把这次发布放回产业坐标里看,它的分量不止于几款新设备。它标志着算力竞争的重心,正在从"单芯片能力"明确转向"系统级协同"——当参数规模、Agent 交互频率和 KV Cache 三重压力同时到来,能在协议、内存语义、存储池化与光电组网这四层同时建立能力、并且既能顶到百万卡又能沉到双机的厂商,才握有下半场的主动权。
正如杨超斌所言,华为将坚持系统级创新,构筑系列化算力底座,开源开放,联合客户、伙伴和开发者共建,为世界提供新选择。在 Agentic AI 对计算需求呈爆发式增长的当下,这句"新选择"的注脚,或许正是整个产业在算力下半场最需要的那份答案:真正的算力优势,不在某一张卡上,而在把千万张卡连成一台机器的能力里。(文/徐培炎)
京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司