扫码分享到微信
【赛迪网讯】算力内卷时代,数据流转成为AI集群性能新拐点。当前AI产业正从“单卡算力比拼”全面迈入“集群效能竞争”新阶段。随着大模型参数量持续飙升、MoE架构成为主流、AI Agent与长文本场景规模化落地,传统依靠GPU堆叠提升算力的模式已然触顶。行业数据显示,AI基建投资重心正向存储与网络迁移,2026年存储芯片在AI基建投资中的占比将突破57%,算力需求也从集中式训练转向常态化高并发推理,十万卡级超大规模智算集群成为产业建设核心方向。

在此背景下,行业核心痛点悄然迭代:单GPU算力持续升级,但分布式集群中多卡、多节点的数据交互时延、资源调度低效问题愈发凸显,算力、网络、存储三者的数据流转效率,正式取代单卡算力,成为制约大模型TTFT、TPOT、算力利用率(MFU)的核心瓶颈。同时,国产AI算力生态正加速自主迭代,在高端算力芯片存在工艺差距的现状下,通过系统级、底层架构级创新实现存算网协同优化,成为国产基建赶超国际水平的关键路径。
针对这一行业痛点,中科曙光正式发布scaleFabric Token加速技术体系,构建算-存-传三级紧耦合的Token加速超级通道,打通AI训练、推理、存储全流程数据流转壁垒。中科曙光高性能计算产品事业部总工程师万伟接受赛迪网采访时,深度拆解了技术内核、落地优势与产业价值,揭秘国产AI高速网络的规模化突破之路。
算力认知重构:Token效能竞争,本质是数据流转效率之争
当前主流大模型均基于Transformer架构,以Token为核心处理单元,Token生成速度与稳定性,直接决定大模型的用户体验与产业落地价值。万伟在采访中明确表示,AI Factory的核心效能与经济效益,最终都体现在Token处理能力上,而随着模型规模化、集群分布式化,单卡算力早已不是决定Token效率的核心因素。
大模型训练与推理的场景特性,彻底改写了AI集群的性能逻辑。在训练阶段,多卡集群需要持续开展All-Reduce、All-to-All等集合同步通信,属于强同步操作,单张算力卡的时延波动都会拖累整体集群效率,通信时延直接决定模型计算利用率(MFU)上限。在推理阶段,行业普遍践行“以存代算”的核心优化思路,通过保存复用KV Cache减少重复算力消耗,由此衍生出Prefill与Decode分离的PD架构,两大阶段的KV Cache跨节点传输,成为推理时延的关键变量。
“无论是训练的梯度同步,还是推理的缓存流转,AI集群的核心工作都是数据交互。”万伟强调,当下行业普遍存在认知误区,认为大模型性能仅由GPU算力决定,但实际落地中,分布式架构下的跨卡、跨节点数据流转,才是限制TTFT(首Token时延)、TPOT(单Token生成时延)提升的核心瓶颈。尤其是MoE架构、长文本推理、RAG检索增强、AI Agent高频调用等主流场景,海量并发小消息通信、大规模缓存读写,让网络与存储的协同能力成为集群效能的决胜关键。
核心技术突破:IBGDA+三维存储加速,攻克分布式AI通信难题
针对AI全流程的数据流转发痛点,中科曙光scaleFabric技术体系构建了算-存-传三级紧耦合的Token加速通道,其中IBGDA(InfiniBand GPUDirect Async)异步直连技术成为本次发布的核心亮点,填补了国内规模化落地的行业空白。
据万伟介绍,传统GPUDirect RDMA(GDR)技术仅优化了数据传输路径,绕过CPU内存拷贝实现网卡与GPU显存的直接交互,但通信任务下发、元数据处理仍依赖CPU参与,无法解决高频小消息通信的时延损耗。而曙光自研的IBGDA技术实现了颠覆性优化,将通信控制、数据处理全流程迁移至GPU端,实现GPU Kernel直接驱动网卡,彻底剥离CPU依赖。
这一突破精准适配当前MoE大模型的核心需求。MoE架构运行过程中会产生海量高频并发小消息的All-to-All通信,是传统网络架构的性能短板,而IBGDA可大幅降低小消息通信时延,显著提升MoE模型的集群推理效率,优化TTFT、TPOT核心指标。作为国内首批规模化落地IBGDA技术的网络产品,scaleFabric实现了GPU自主发起、自主管理数据通信的前沿技术思路。
在存储加速维度,scaleFabric构建了NFS over RDMA、XDS、NVMe over RDMA三位一体的高速存储通道,全方位适配AI训练、推理的差异化存储需求,三者协同互补、深度耦合,覆盖全业务场景。其中,NFS over RDMA适配训练数据加载、Checkpoint文件读写等文件型访问场景;NVMe over RDMA聚焦KV Cache、热点数据缓存等块存储高频场景,提升热数据读写效率;XDS技术则实现GPU显存与远端存储的直连互通,绕过本地内存拷贝,大幅简化数据流转路径。
网络底层性能上,scaleFabric具备对标国际顶尖InfiniBand的硬核实力,单跳转发时延低至260纳秒,端到端时延不足1微秒,多跳大消息时延较主流RoCE方案降低63%。同时依托严格无损网络协议,无需依赖PFC近似无损机制,可支撑十万卡级大规模集群组网,避免规模化部署后的性能衰减,完美适配超大规模AI集群的稳定传输需求。
落地适配无门槛:全场景兼容,低改造成本赋能产业落地
技术创新的核心价值在于落地赋能。针对行业普遍关注的场景适配性、改造成本问题,研发团队表示,scaleFabric技术体系具备极强的灵活性与兼容性,可全面覆盖中小模型微调、超大模型训练、高并发在线推理、RAG知识库复用等全层级客户需求,且对上层业务极度友好。
在场景适配层面,中小模型微调的单节点训练场景无需跨节点通信,可原生适配;当模型规模扩大,进入数据并行、模型并行的跨节点训练阶段,scaleFabric的低时延、高吞吐优势即可充分释放。在RAG、AI Agent等高频推理场景中,该技术可高效支撑分布式存储与计算节点的高速通信,大幅提升知识库加载、缓存复用、高频调用的整体效率,实测场景整体性能可提升20%-30%。
更低的落地门槛是规模化普及的关键。据介绍,IBGDA技术对上层AI框架、业务代码完全无感,基于DeepEP等框架的现有业务无需修改任何代码,可直接迁移运行。目前该技术已完成NVIDIA生态及多款国产算力卡的底层适配,针对其他国产加速卡,曙光可提供参考代码,适配工作量可控、落地风险极低,真正实现“开箱即用”。
同时,scaleFabric采用完全自主研发的开放架构,不依赖国外技术体系,可与国产GPU、CPU及各类硬件厂商深度协同适配,在传统RoCE、英伟达IB方案之外,为产业提供高性价比的国产原生无损RDMA网络方案,补齐国产AI基础设施生态短板。
产业价值凸显:系统级创新,助力国产算力弯道超车
当前国产算力产业面临核心困境:国产单卡算力短期难以追平国际顶尖产品。在此背景下,依靠单卡性能比拼的赛道已无优势,通过集群互联、存算网协同的系统级创新,提升整体集群效能,成为国产算力自主迭代的核心路径。
万伟表示,IBGDA的规模化落地,核心价值在于重构了国产多卡集群的算力释放能力。通过优化多节点、多卡之间的通信效率,最大限度降低集群算力损耗,让国产算力集群实现“以集群规模补单卡差距、以协同效率提整体性能”的突破,打破国外高端网络技术的垄断,为国产AI基础设施的自主可控、性能升级提供核心支撑。
从行业趋势来看,AI集群集群化、规模化已成必然,低时延网络、高性能存储的全流程优化,将从可选配置转变为AI计算集群的标配能力。scaleFabric的技术突破,恰好契合产业发展趋势,解决了大规模集群组网的时延、稳定性、扩展性三大核心难题,为十万卡乃至百万卡级超大规模智算集群建设筑牢底层基础。
未来迭代规划:持续深耕底层创新,共建国产AI生态
面向未来超大规模集群组网、前沿模型迭代、产业生态完善的需求,中科曙光公布了scaleFabric的持续迭代路线图。技术层面,下一代产品将向更高带宽、更大交换容量升级,推出800G高速网络产品与网卡,同时新增优化拥塞控制算法、多平面传输、包喷洒、乱序重组等能力,进一步降低长尾时延,提升大规模集群的稳定性与负载均衡能力。
针对十万卡以上超大规模集群的运维痛点,scaleFabric将持续优化免维护网络管理能力,强化链路故障快速自愈、智能路由恢复功能,解决大规模组网中的局部抖动、故障扩散等行业难题,保障超大型AI集群的长期稳定运行。官方预告,9月中下旬将发布PD分离推理场景专项测试报告,通过同带宽、同硬件的对标测试,直观验证scaleFabric相对传统RoCE方案的性能优势。
生态层面,中科曙光将持续秉持开放协同理念,加速与更多国产硬件厂商的产品适配与联合优化,完善全国产AI网络加速生态。万伟表示,未来将依托自主可控的核心技术,联动上下游产业链,持续优化Token全流程加速能力,为国产大模型训练、推理、落地提供低成本、高性能的底层基础设施支撑,推动国内AI计算产业规模化、高质量发展。
从“算力为王”到“流转制胜”,AI产业的底层竞争逻辑已然重构。中科曙光scaleFabric Token加速技术体系的发布与规模化落地,不仅是IBGDA、三维存储加速等核心技术的单点突破,更是国产AI基础设施从“硬件堆叠”走向“系统协同”的标志性跨越。在国产算力自主可控的浪潮下,这套全流程、高适配、低成本的底层加速方案,将持续释放集群算力价值,成为国产大模型产业规模化落地、技术持续迭代的核心底座。(文/徐培炎)
京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司