扫码分享到微信

上周 OpenRouter 公布的全球大模型调用量榜单上,发生了一件有点讽刺的事。排在第一的不再是 GPT 或者 Claude,而是 DeepSeek-V4-Flash,单周调用 7.22 万亿 Token;前五名清一色是中国模型,小米 MiMo-V2.5、腾讯 Hy3、DeepSeek-V4-Pro、智谱 GLM-5.2 紧跟着排满。同一周,OpenAI 的 GPT-5.6 Luna 罕见地降价 80%,却只勉强挤进第八名——周调用 1.95 万亿 Token,环比暴增 456%,像是连夜追赶的样子。
把这两件事放在一起看就有意思了:一边是国产模型在调用量上碾压,一边是闭源旗舰在靠降价挽尊——价格和用量第一次出现了明显的倒挂。
往前数八周,阿里 Qwen3.8-Max、月之暗面 Kimi K3、DeepSeek-V4-Flash、智谱 GLM-5.2、字节 Seedance 2.5 接连亮相。彭博社把这叫做"中国 AI 闪电战",Artificial Analysis 则画了一条"DeepSeek 死亡地带":性能追不上、价格又降不下来的模型,横竖都是死。热闹归热闹,对企业 CTO 来说,这些新闻背后藏着一个躲不开的问题——
你的 API 底座,到底该押国产开源,还是继续留闭源?
我先把话说清楚:这不是一道"哪个更好"的题(如果你还停留在"闭源更强所以选闭源",或者"国产更便宜所以全换"这种非黑即白的判断),而是想替你把它拆成能直接拿去开会的决策。在写下这篇文章前的发现是,大家卡住的从来不是"有没有国产模型可用",而是"我的预算该往哪边投才不后悔"——这道题,没有任何一场厂商发布会能替你答。
先把几件两边都认的事实摆出来。不然后面的分歧没法谈,也容易陷入各自站队。
第一,性能差距确实收窄了。斯坦福《2026 人工智能指数报告》的判断是,中美顶尖模型的综合性能差距已经大幅缩小;多家机构实测下来,国产旗舰和 Claude、GPT 在大多数任务上的差距只剩下 1% 到 4%。这个"1% 到 4%"很关键——它说明在大量日常任务上,普通人已经感知不到中美模型的区别。比如摘要、翻译、基础客服问答、代码补全这类占了企业 AI 用量八九成的活,国产模型已经能做到让用户分不出差别。一个做 AI Agent 的美国初创公司 Lindy,因为 API 账单一度超过全员薪资,从 Claude 切到 DeepSeek-V4 之后,推理成本直接掉了 95%,一年省下数百万美元。注意,它不是"凑合用",是在几乎不掉性能的前提下换掉了供应商。这个案例之所以重要,是因为它第一次让"换底座"从口号变成了可复制的财务动作:降 95% 成本却没有付出性能代价,说明差距真的薄了。它切完之后没收到一条用户投诉说"变差了",这才是关键——省成本不稀奇,省成本还不掉链子才稀奇。
第二,成本成了选型里真正决定性的一票。Artificial Analysis 的实测里,完成同样的工作负载,DeepSeek 只要 0.03 美元,Claude Fable 5 要 3.15 美元——价差超过 100 倍。哪怕是低频场景,中美对应档位的 API 价差也能到数倍;高频 Agent、大规模代码生成这类场景,省 80% 到 95% 是常态。Coinbase 把中国大模型设成工程师默认工具,靠模型替换加智能路由,全公司 AI 支出压了近一半;印度大量中小科技公司整体 AI 成本降了一个数量级,约 90%。这些不是 PPT 上的数字,是真金白银跑出来的。换算成单价更直观:国产 Flash 类模型每百万 Token 往往只要几分钱,闭源旗舰要几美元——这个量级差,是 MoE 架构和成本结构决定的,不是促销能抹平的。更深一层看,为什么价差这么大?因为国产模型走的是 MoE 架构加推理侧深度优化,用工程效率对冲了硬件劣势,而闭源旗舰的定价里还背着高昂的训练沉没成本——同样的活,成本结构根本不在一个量级。
第三,开源不再是个"备胎选项"。Hugging Face 2026 春季报告里,中国开源模型已经占到平台月度及累计下载量的 41%,超过美国模型;工信部 7 月的数据更狠,国产开源大模型全球累计下载量破了 100 亿次,OpenRouter 上最受欢迎的前六大模型全来自中国机构。Kimi K3 直接把权重完全公开,开发者下载下来自己部署,连 API 计费都绕过去了。开源这个词,今年已经从"便宜的平替"变成了"全球产业格局再平衡的关键变量"——换句话说,企业第一次能不经过任何中间商,直接把最强模型握在自己手里。
第四,开源的"工具链"也成熟了。两三年前,把一个开源大模型跑起来还得自己调推理框架、显存、并发,门槛不低;现在 vLLM、SGLang、Ollama、llama.cpp 这套东西已经相当标准化,中小团队照着文档几天就能部署上线。工具成熟带来的变化是:换底座不再只是"敢不敢"的问题,而是"想不想"——这是成本派敢大张旗鼓搬家的前提。换个角度说,过去护着闭源锁客的那道"部署门槛",已经被开源社区自己拆掉了。
共识之外,才是真正有意思的地方。面对"该押谁",企业其实分裂成三派,而且每一派手里都有硬数据,谁也说服不了谁。
成本派最干脆。性能够用就行,价格差着一个数量级,闭源凭什么?他们把"DeepSeek 斩杀线"挂在嘴边——性能追不上、价格又降不下来的模型,迟早被淘汰。这类企业多是调用量大、毛利薄、对极致性价比敏感的,比如做客服、做内容生成、跑高频 Agent 的,搬家成本在他们账上就是利润。对一个每天烧几万次调用的团队来说,"便宜 90%"不是概念,是活下去和活不下去的区别。他们的逻辑链条很硬:性能差 1% 到 4% 用户无感,价差 60% 到 90% 财务有感,那理性的选择就是换。做个粗略的账:一个日均 500 万次调用的客服系统,从闭源切到国产开源 Flash,按 0.03 对 3.15 美元的价差,一年光 API 费就能省下大几百万,这还没算闭源随时可能涨价的那笔风险溢价。
性能生态派反着来。真到了尖端推理、长链条多步任务、复杂多模态,闭源还是更稳。一位做法律合同起草的 CTO 跟我聊过,他的核心场景是"一份合同里埋着的逻辑漏洞",这种任务国产模型目前还会出岔子,他宁可多花几倍钱用 Claude。更现实的理由是运维:闭源的"即开即用"和全托管,对没有 MLOps 团队的中小公司是刚需。Qwen、DeepSeek、Llama 三足鼎立归三足鼎立,可很多公司根本没有人手去养一套开源模型的部署和监控——51CTO 测算过,自建推理要养 15 到 25 人的 MLOps 团队,年薪资 500 到 800 万,这还没算 GPU 集群折旧。对他们来说,"省下的 API 费"会被"招人的薪资"吃掉一大半。性能派赌的,是那最难 5% 的任务长尾还没被填平,而它恰恰卡在最有价值的场景上。更别说闭源背后的生态:插件市场、函数调用、企业级 SLA、随叫随到的技术支持,这些对把 AI 当生产系统而不是玩具的公司,往往比单价更值钱。
主权派想的不是钱,是合规。金融、医疗、政务这些强监管行业,数据出境本身就是灰色地带,哪怕服务商承诺不拿你的数据训练,传输和处理过程的安全可控性也始终是个问号。开源模型部署在自有服务器上,数据不出机房,合规审计里这是明确加分项——等保三级、GDPR 这类硬性要求,私有化部署能直接满足,API 调用却始终绕不开"数据出去过一圈"的原罪。仅凭这一条,很多受监管行业就足以拍板"必须私有化部署"。对他们而言,选国产开源不是因为便宜,是因为别无选择,这是监管替他们做的决定,不进性价比讨论。而且合规的边界还在往外扩:从等保、数据安全法到各行业细则,监管对"数据留在哪"的要求只会越来越细,留给灰色地带的空间越来越小。
三派看着是路线之争,根子上是对两件事的判断不同,而这两件事都没法靠辩论解决。
一是"性价比拐点到底到了没有"。成本派认为已经到了——性能差 1% 到 4%,价格差 60% 到 90%,这笔账闭着眼都能算。性能派认为没到——他们盯的不是榜单平均分,是最难那 5% 的任务,那部分差距还没抹平,而生产环境里崩一次的代价,远高于平时省下的 API 费。说白了,双方在赌不同的"长尾":成本派赌长尾已经被填平,性能派赌长尾还在。这种分歧,本质是两家公司对"自己业务里最难的活"长什么样,理解完全不同。再往深一层,两边算账的模型也不同:API 费用是线性随调用量增长的,GPU 集群的边际成本却是递减的,所以调用量越大,私有部署越划算——成本派多是高频场景,自然先到了拐点;低频场景反而闭源更省,这就是为什么同一道题,有人觉得"早该换",有人觉得"还早"。
二是"数据出境的风险值不值得用成本去换"。主权派把合规当硬约束,性能派和成本派把它当可优化的软约束。这种分歧同样没法吵出结果,因为它取决于你所在的行业、你手里的数据、你面对的监管。一家做跨境电商的公司的风险账,和一家城商行的风险账,根本不是同一本。说到底,这是一种"风险偏好"的分裂,不是事实判断的分裂。
三是"好模型"的标准本身在分裂。闭源派信的是榜单均分和基准测试,开源派信的是自己业务里的真实跑分;一个看的是"平均强不强",一个看的是"我的场景稳不稳"。两套标准聊不到一块,也是分歧总也调不合的隐性原因——很多时候双方说的,根本不是同一个"好"字。这也是为什么第三方榜单越做越多、却越难让人口服心服,因为大家先默认了不同的评分尺子。
所以这道题没有标准答案,但有一张能直接用的决策地图。我的建议是按业务分层,而不是全押一边——这也是目前主流 CTO 实践里最稳的打法。
海量、高容错、成本敏感的吞吐型任务,比如日常对话、内容生成、客服 FAQ、大规模代码补全,直接上国产开源的 Flash 类模型。调用量大的走私有化部署,把成本打下来。Lindy 和 Coinbase 就是这么干的,省下来的都是净利润。这部分别犹豫,性能够用、价差巨大,换底座的 ROI 清晰得不像话。判断标准很朴素:如果你的 AI 调用里,超过七成是这类"标准件"任务,那就没理由继续给闭源交溢价。
尖端、低容错、长链条的推理任务,比如复杂法律或医疗问答、多步 Agent 编排、精细多模态,留闭源,为那尾部 5% 的可靠性付费。这部分钱不该省——它保护的是你最值钱、最不能出错的场景。把账算长一点:51CTO 那份三年 TCO 测算显示,闭源 API 三年约 600 到 1200 万,开源私有部署约 1500 到 2500 万,但这是在中等调用量下的结果;一旦日均调用过了 200 万到 300 万次的拐点,开源的规模效应就会反超。所以关键不是"开源贵还是闭源贵",是你的量在哪个区间。换句话说,尖端场景的"贵"是一笔保险费,买的是那 5% 不出错的确定性;值不值,取决于你那 5% 出错一次要赔多少。
涉敏、强监管的数据,金融、医疗、政务的核心业务,强制国产开源加私有部署,数据不出域是底线。这一条不进性价比讨论,合规成本是公司没法承受的代价。
剩下那些"说不清"的中间地带,别拍脑袋,先跑三个月并行测试,用你自己的真实调用数据说话。风险维度上也要看清:闭源的雷是 API 涨价、服务可用性依赖、数据出境;开源的雷是运维能力、安全漏洞响应速度、版本迭代的不可控。混合架构——开源做日常和私有化基座、闭源补强复杂推理——正在成为多数企业的最优解,因为它在成本、能力、风险三个维度上都取得了不错的平衡。
落到实操,给你一张能马上用的判断表:日均调用过 200 万次、任务容错高、数据不敏感,闭眼上国产开源私有化;任务一出错就赔钱、调用低频、没人手养 MLOps,留闭源 API 别折腾;数据涉敏或强监管,私有化是底线,不进性价比讨论;介于两者之间,先并行跑三个月,用真实日志拍板。还有三条红线要记牢:别为了省 API 费,把核心推理换成还没稳定的开源模型;别在没人手的情况下硬上自建;也别指望一次选型管三年——模型迭代以周计,你的架构得留好退路;更别被单周榜单带着跑,一周的排名说明不了你明年该用什么。
回到开头那张榜单。八周五款国产模型,GPT-5.6 Luna 紧急降价 80%,这些热闹容易让人产生"闭源要完"或者"国产稳赢"的错觉。但对企业来说,选型从来不是站队,是一道工程题。榜单会每周刷新,降价也会继续,可你的业务结构不会每月变——别让一周的排名替你做三年的架构决策。
便宜正在打败贵,这是真的;可可靠性和数据主权,也不是靠便宜就能抹掉的。2026 年的大模型选型,比的不是谁嗓门大,是谁能把自己的业务拆开,知道哪块该省、哪块该花、哪块碰都不能碰。把时间拉长看,这更像是全球 AI 正在裂成两套并行的系统:一套是英伟达加闭源模型主导的全球通用生态,另一套是中国自主可控的全栈体系——企业选型,本质上是在为自己挑一个能长期待得住的时区。
所以明天早上你打开电脑要做的第一件事,不是去搜"哪个模型最强",而是拉出你们自己的调用日志:高频还是低频、容不容错、数据敏不敏感。把这三列填完,答案八成已经出来了。
说到底,"开源还是闭源"这个问题的答案,不在任何一份榜单里,在你自己服务器的那堆日志里——去翻翻吧,比看任何一篇测评都有用。(文/王子祺)
京ICP证000080(一)-16
京公网安备11010802009845号
北京赛迪网信息技术有限公司