扫码分享到微信
【赛迪网讯】当国产GPU硬件完成规模化落地、开源大模型实现局部超越,中国AI算力产业正在告别“抢卡、堆硬件”的粗放增长时代。行业共识已然清晰:算力竞争的下半场,从来不拼硬件数量,而拼软件生态、工程化能力与规模化服务效率。
在GPUStack AI Infra生态与技术创新大会现场,GPUStack CEO秦小康、CTO梁胜、COO江鹏,以及核心战略合作伙伴帝欧水华集团董事长朱江,接受赛迪网采访时,围绕国产算力现存痛点、异构算力治理、Token工厂产业逻辑、开源生态壁垒与商业化落地路径展开深度对谈,完整拆解了国产算力从“能用”走向“好用”的底层逻辑、技术解法与产业终局。
四位受访人分别从产业趋势、底层技术、工程落地、商业实战四大维度,还原了当前国产AI基础设施的真实行业现状,也勾勒出国内算力产业标准化、工业化、全球化的全新发展路径。
行业需求彻底迭代,算力竞争从“有卡”转向“跑通模型”
秦小康接受采访时,首先点明了近两年AI算力行业最核心的结构性变化,彻底颠覆了此前行业“得显卡者得天下”的固有认知。他表示,过去一两年,政企、企业的核心诉求是囤积算力硬件,各地大规模建设数据中心、采购GPU卡,行业普遍认为手握硬件就是手握资产,这也让GPU资源长期处于紧缺状态。

GPUStack CEO 秦小康
但随着国产大模型快速崛起,开源模型能力持续追平甚至部分超越海外闭源模型,企业的需求发生了巨大转变。单纯采购硬件已经无法满足业务需求,行业真正的痛点变成了“如何在自有私有环境中,把模型稳定、高效、合规地跑通”。
“很多用户用公有云模型时感受不到复杂度,真正自建私有化算力平台后,才会发现整套工程体系的难度极高。”秦小康坦言,当前行业存在几十类GPU硬件、数千个开源模型、十余种推理后端,叠加各类优化方案,形成了阶乘级的适配复杂度,绝大多数企业根本无法独立完成全链路适配与调优。
他总结了制约国产算力落地的两大核心卡点,也是行业80%故障问题的根源:第一是推理后端适配难题,模型是无状态参数文件,无法直接运行,必须依托专属推理后端搭建运行环境,不同硬件、模型、框架之间适配壁垒极高,新场景落地周期漫长;第二是性能严重虚耗,国产GPU硬件标称性能可达英伟达70%-80%,但因软硬件适配不足,实际Token产出仅为理论值10%,硬件潜力被严重浪费。
基于行业痛点,GPUStack提出了Token工厂的核心产品理念。秦小康解释,Token工厂的核心不是简单的GPU资源调度,而是一站式解决“硬件纳管、模型适配、推理优化、服务输出”全流程问题,让企业无需深耕底层工程,即可一键部署模型、稳定输出Token服务。
在行业趋势判断上,秦小康指出两大标志性变革,奠定了异构算力与国产软件栈的产业价值:一是开源模型全面崛起,打破闭源模型垄断,成为行业主流落地选择;二是国产GPU跨硬件训练成为常态,DeepSeek等头部模型完成多硬件适配,证明异构算力时代全面到来,也让GPUStack的异构统一治理能力拥有了不可替代的产业价值。
算力产业缺的不是硬件,是统一的“算力操作系统”
作为GPUStack技术体系的搭建者,梁胜从产业底层架构出发,拆解了国产算力生态滞后的核心原因。他表示,行业普遍误解算力竞争是硬件参数的竞争,实则差距在于完整的软件体系与标准化工程能力。

GPUStack CTO 梁胜
梁胜用PC产业演进做了经典类比:当下的AI算力行业,如同90年代的PC行业,硬件品类繁多,但驱动、系统互不兼容。各类国产GPU相当于不同品牌显卡,大模型相当于各类应用软件,而推理后端就是核心“驱动程序”,GPUStack则是面向算力中心的新一代操作系统。
“编排调度不是最难的,真正卡住行业的,是推理引擎的适配、调优与迭代,这是整个行业尚未完全攻克的核心难题。”梁胜强调,海外成熟算力生态的核心壁垒,是贯穿计算、存储、网络、推理、服务的全栈软件能力,而这正是国产算力长期缺失的短板。
针对行业热议的Token工厂概念,梁胜明确厘清了产业层级:GPUStack底层是算力工厂,负责硬件集群管理、多租户隔离、资源调度、推理优化、算力标准化生产;上层的Token工厂是面向终端用户的标准化服务,负责Token稳定输出;最上层的智能体、对话应用则是Token的消费端。GPUStack的核心定位,是做好中间层的算力生产与服务标准化,屏蔽底层复杂度。
谈及产品壁垒与行业对标,梁胜表示,海外红帽等厂商聚焦底层技术,依赖二次开发,无法适配国产GPU体系,也无法直接输出Token服务。而GPUStack依托开源模式,打造轻量化、标准化、可直接落地的产品体系,精准适配国内私有化部署、低门槛落地的产业需求。
他补充,算力行业正在告别项目制定制开发模式。万卡级超大集群可依托定制化开发落地,但未来海量中小算力集群、私有化部署场景,必须依靠标准化产品。GPUStack的核心目标,就是通过开源迭代,成长为国产算力基础设施的事实标准。
异构算力优化无万能公式,开源社区飞轮持续放大算力价值
江鹏从工程落地、性能优化、产品迭代与商业模式角度,分享了GPUStack的实战落地经验与产品架构逻辑。异构算力的性能优化没有固定数值、没有万能黑科技,最终效果高度依赖模型架构、硬件类型与业务场景。

GPUStack COO 江鹏
他以真实落地案例佐证平台价值:某金融客户基于华为NPU运行GLM-4.7模型,原生环境优化效果极差,接入GPUStack平台后,吞吐量提升8-9倍,推理延迟下降80%-90%;常规场景下,通过PD分离、EPD分离、共享KV Cache等技术,可将国产GPU算力利用率从50%-60% 提升至60%-70%。
同时,江鹏坦言,单靠平台层无法完成全维度优化,算力效能提升需要GPU厂商、开源社区、平台方三方协同。当前MOE模型、多模态模型快速迭代,单次新模型适配往往需要修改数万行代码,封闭生态无法适配行业快速迭代的节奏,开源协同才能够跟上产业速度。
依托全球11万+用户的开源社区飞轮,GPUStack积累了海量跨硬件、跨模型、跨场景的真实数据,形成“用户实测-问题反馈-版本迭代-场景验证”的闭环,这也是产品能够持续打磨、适配性持续领先的核心原因。
针对行业关注的开源与商业平衡问题,江鹏公布了清晰的产品策略:通用核心能力、轻量化部署能力、基础适配能力全部开源,普惠所有开发者与中小机构;大型集群运维、高阶调度、专属技术支持等企业级能力纳入商业版本,服务政企、运营商、超大规模算力集群场景,兼顾生态普惠与商业可持续。
硬件红利终将消退,软件生态决定算力长期竞争力
作为GPUStack核心战略投资方与产业合作伙伴,帝欧水华集团董事长朱江从算力基建、产业投资、商业落地的产业视角,分享了对行业终局的判断。

帝欧水华集团董事长 朱江
朱江首先点明行业趋势拐点:当前国产GPU供货紧张,但未来产能持续释放后,硬件供给将趋于充足,硬件红利会彻底消失,软件运营能力将成为算力企业的核心竞争力。四川依托充沛水电资源,具备长期电价优势,是国内算力基建的优质落地载体,但硬件集群建成后,能否高效利用、稳定产出Token服务,完全依赖软件平台能力。
谈及投资GPUStack的核心逻辑,朱江总结了四点核心判断。第一,开源模式具备极强的生命力,在国产GPU供货受限的前提下,平台用户已从8万增长至11万,全部依托社区自然传播,未来硬件解将迎来爆发式增长;第二,开源社区协同迭代的模式,摆脱了传统企业“烧钱堆人力修bug”的低效研发模式,产品迭代速度与稳定性远超传统项目制团队;第三,当前国产GPU厂商聚焦硬件交付,行业极度缺失成熟的软件操作系统,GPUStack恰好补齐产业核心短板;第四,推理赛道比拼的是工程化落地能力,而非模型创新,企业无需自建底层研发团队,依托标准化平台即可低成本落地算力业务。
作为一线算力运营方,朱江分享了实战痛点:早期团队曾自研算力纳管体系,投入数百万成本仍踩坑无数,而GPUStack可实现20分钟快速部署、直接对外输出Token服务,极大降低了算力运营门槛,尤其适配高校、创业团队、中小企业的轻量化部署需求。
他表示,帝欧水华将算力业务定位为企业第二增长曲线,未来将持续建设大规模国产算力集群,依托GPUStack的标准化能力压低Token生产成本,打造具备市场竞争力的普惠算力服务,同时深度参与国家一体化算力网络建设,助力国产算力规模化落地。
开源协同定义国产算力新范式
整场采访中,四位核心嘉宾的观点形成了完整的产业逻辑闭环:秦小康锚定行业需求迭代,点明算力产业从“囤硬件”到“跑通业务”的核心转变;梁胜拆解底层技术架构,定义算力操作系统的产业价值;江鹏落地工程化与产品化,用实战数据验证平台能力;朱江立足产业运营与投资视角,印证开源生态的长期竞争力。
随着国产GPU硬件持续成熟、开源模型生态不断完善,AI算力产业的竞争进入生态决胜阶段。以GPUStack为代表的开源软件底座,正通过开放协同、技术迭代、产业共建,打通芯片、硬件、模型、应用全链路壁垒,推动国产算力彻底告别“可用不可用、有量无效”的困境,稳步迈向高效、普惠、规模化的“好用”新时代,为中国AI基础设施产业全球化突破筑牢核心根基。(文/徐培炎)
从“算力为王”到“流转制胜”,AI产业的底层竞争逻辑已然重构。中科曙光scaleFabric Token加速技术体系…
前天京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司