21世纪经济报道记者 陈归辞 邓浩
大模型价格战正在出现一个矛盾的场景:模型原厂提高官方API价格,同一份开源权重在第三方市场上的调用价格却持续下降。
8月13日,DeepSeek在发布V4-Pro正式版的同时宣布调整API价格,并引入峰谷计费。新价格于北京时间8月17日零时生效,高峰时段输出价格为27元/百万tokens,缓存未命中价格为9元/百万tokens,缓存命中价格为0.30元/百万tokens,分别为此前价格的4.5倍、3倍、12倍。空闲时段价格统一为高峰时段的一半。
智谱GLM Coding Plan新版订阅套餐Lite、Pro、Max 月费分别为 118 元、538 元和 1078 元,此前为49元、149元、469元,三档分别上涨约 141%、261% 和 130%。同时,计费方式由此前的请求次数限制,改为以Token消耗为基础的积分制。非高峰时段则可享50%基础积分消耗的抵扣。
但在主流聚合调用平台OpenRouter上,另一条价格曲线正朝相反方向运动。
目前,同一款DeepSeek V4-Flash-0731由数十家服务商提供推理服务,Open Inference的报价低至0.05美元和0.16美元,Sail Research、AkashML等服务商报价为0.065美元和0.18美元。最低报价只有官方低谷价格的约四分之一。
GLM-5.3在AkashML、Decart、io-net等服务商上的报价降幅为5%至16%;GLM-5.3 Flash在GMICloud、NovitaAI、DeepInfra等服务商上的报价降幅则达到50%。
“抬价的是原厂对自己端点的定价权,压价的是别人拿同一份权重做托管的边际成本。”新加坡无限对齐创始人、Codex生态合作伙伴宋斐对记者表示。
两条反向运动同时出现,意味着开源模型的权重、推理服务和最终产品正在被拆分,原厂牌价不再等同于模型的市场服务价格。
为什么市场价能继续下探?
实际上,原厂与第三方托管商出售的并不是完全相同的商品。
DeepSeek需要承担模型训练、后训练、安全评估、版本迭代以及官方API稳定性等成本,还要为高峰并发预留推理资源。第三方托管商获得开放权重后,主要竞争的是如何更低成本地完成推理,可以通过不同芯片、量化精度、批处理、缓存和集群调度压缩边际成本。
此外,Agent的兴起还改变了官方API的负载结构。
与普通问答相比,Coding Agent需要反复携带系统提示、工具定义、代码仓库信息和历史轨迹,大量请求具有相同或相似的前缀,因此高度依赖上下文缓存。缓存可以减少重复计算,但对应的KV Cache仍会持续占用显存。在并发高峰期,长上下文、长输出的Agent任务可能明显挤占推理容量。
此前DeepSeek调价中,涨幅最大的正是Agent负载高度依赖的缓存命中输入。以V4-Pro为例,缓存命中输入的低谷、高峰价格分别达到旧价的6倍和12倍;缓存未命中输入和输出价格的涨幅相对较低。
DeepSeek官方将峰谷定价解释为更合理地调配资源、维持服务稳定,并未直接表示调价针对Agent流量。宋斐认为,从价格结构看,其实际效果是提高高峰Agent负载的成本,引导可延后的批量任务转向低谷时段,从而缓解显存和推理容量压力。
第三方托管商则面临另一套商业逻辑。权重开放后,任何具备部署能力的云厂商都可以围绕同一模型提供服务。部分服务商使用低成本GPU或国产芯片,部分通过FP8、INT8等量化方式减少显存和计算消耗,也有厂商愿意用促销价格换取利用率、客户和流量。
由此,研发模型的公司不再垄断模型的推理供给。原厂可以决定官方API的价格,却无法阻止其他公司围绕同一份权重展开成本竞争。
OpenRouter等聚合平台进一步放大了这种分化。同一模型的价格、速度、可用率、缓存政策和数据留存方式被放进同一张供应商列表,用户可以根据价格或性能选择路由。原本分散的云服务由此成为一个可直接比较的市场。
不过,最低报价也不能简单等同于全市场成交价。不同端点在量化精度、工具调用效果、并发保障、数据留存和故障率上存在差异;一些折扣也可能是阶段性促销。
原厂靠什么赚钱?
当开放权重的推理服务逐渐商品化,单纯出售token将越来越难以维持长期溢价。原厂必须将定价权转移到推理服务之外。而且原厂之间的竞争也日趋激烈,刚刚过去的两个月之内,国内大模型厂商旗舰模型密集发布。
在万创投行董事总经理苏婉怡看来,头部模型之间在用户可感知层面的差距已经很小,缺的是“能力 + 成本 + 国产化适配”三者均衡的综合实力——推理成本控制能力、工具调用能力、Agent稳定性、企业场景的交付能力。
苏婉怡认为,模型厂商真正的定价权来自两处:一是推理成本,谁能把每token的边际成本压下来,谁就有降价的空间;二是生态黏性,开发者把应用建在你的模型上,迁移成本高,这才是壁垒。
“行业正在从‘稀缺溢价’走向‘效率竞争’,接下来比拼的是算力结构和生态黏性。”苏婉怡对记者表示。
智谱近期围绕GLM模型、ZCode和Coding Plan形成的组合,可以被视为原厂重建定价权的一种尝试。
8月,智谱发布GLM-5.3和GLM-5.3-Flash,同步全量开放包括Lite、Pro、Max和团队版本的GLM Coding Plan订阅,以订阅制交付编码智能体能力。同月,ZCode宣布全面升级,推出Goal、Subagents、Remote Control以及闲时任务四大功能。据智谱介绍,目前ZCode用户数已突破100万。
智谱正在加快构建的这套“基础模型+Coding Harness+订阅服务”AI编程生态,瞄准的是推理服务之外的价值空间:模型调用越趋向商品化,单一模型的替代成本越低;但一旦模型嵌入开发环境和开发工作流,用户迁移所需要付出的代价就不仅是重新更换一个API,更是重新适配整个工作环境。
这也意味着,用户购买的不再只是某个模型的token,而是可接入主流编程工具的额度、模型能力和开发工作流。即使底层API面临降价压力,产品订阅仍可能通过便利性、稳定性和迁移成本保留溢价。
另一种夺回定价权的方式是把定价权写进许可条款和工程中。
7月,月之暗面发布Kimi K3,随这款2.8万亿参数大模型的权重一同发布的是“Kimi K3 License”。Kimi放弃了此前宽松的MIT许可,规定任何企业及其关联方如果以MaaS方式直接向第三方提供推理或微调服务,且连续12个月收入超过2000万美元,必须与月之暗面另行达成商业协议。同时,对于月活超过1亿或月收入超过2000万美元的产品,必须在界面显著位置标注“Kimi K3”。
K3依然允许下载、修改、微调和商业使用,对于绝大多数开发者和中小团队而言,这些条款并无实际影响;但对于云厂商、模型聚合平台等大玩家而言,“免费午餐”结束了。
DeepSeek和智谱的权重是全精度发布,第三方拿到之后可以自己量化、换芯片、调批处理,成本压得比原厂低。K3的做法把这条路堵了一半。
“K3权重发布时就是训练用的低精度,第三方拿到手,往上转精度没有收益,往下再压又要掉效果,量化这一档的成本空间基本没了。推理这块月之暗面只开了模型执行的部分,生产环境里怎么调度、怎么排缓存、哪些请求前缀热,这些都是在自家流量上跑出来的,第三方没有这份流量,同样的硬件跑不到同样的利用率。所以K3和DeepSeek不一样,第三方在成本上占不到便宜,护城河从权重挪到了托管效率,再加许可条款兜底。”宋斐表示。
中软国际此前已公开宣布“商业层面采用Token分成机制,对基于Kimi大模型产生的Token消耗收益及其他合作衍生收入按约定比例分成”。另据近日市场消息披露,月之暗面正与微软、亚马逊和谷歌谈判,希望让K3进入Azure、AWS和Google Cloud,并从相关服务获得的收入中拿走最高30%的分成。
此外,还值得注意的是,近日智谱又将Coding Plan搬上了天猫销售。仅一天后,天猫又将阿里云、DeepSeek、Kimi、MiniMax等多家头部大模型厂商的订阅服务集中到“天猫AI空间站”上销售。
大模型登上电商平台,意味着AI订阅开始从模型厂商官网和托管商的销售渠道,走向第三方电商平台的标准化货架。原先主要面向开发者和企业客户的订阅服务,如今尝试向更多普通消费者敞开。可以想象,未来AI订阅可能像买流量包一样被比价和促销。