大模型行业正在出现一条斩杀线。
不是开源模型每一项都超过闭源模型,而是它们开始在足够多的真实任务里越过“够用线”。
一旦模型够用,价格就会变成问题。
一旦价格变成问题,闭源模型就不能再只卖“更强”。它必须证明自己贵得有道理。
这就是 Kimi K3 和 DeepSeek V4 Flash 放在一起时,真正有意思的地方。
Kimi K3 负责把开源模型的能力上限顶到第一梯队。DeepSeek V4 Flash 负责把 Agent(智能体,能连续执行多步任务的 AI)调用成本压到足够低,尤其是编程场景。一个打能力,一个打价格。
合在一起,它们不是简单地宣布“闭源模型没用了”,而是开始问闭源模型一句很难回答的话:
你贵这么多,到底贵在哪里?
一、过去的问题是:开源能不能追上
过去一段时间,开源模型一直在回答一个问题:
我能不能追上闭源模型?
这个问题的隐含前提是,闭源模型默认更强,开源模型负责追赶。用户付费给闭源模型,买的是更高的能力上限、更稳定的体验、更少的折腾。
只要能力差距足够明显,价格就不是最核心的问题。
你不会拿便宜的替代品去处理高风险任务。写关键代码、长上下文分析、多轮工具调用、重要决策辅助,这些场景里,用户愿意为确定性付费。
但现在问题开始变了。
Kimi K3 整体表现仍落后于最强闭源模型——官方自己也承认这一点。但它已经是一个 2.8 万亿参数、百万级上下文的开源大模型,面向长程代码编写、知识工作和推理,性能进入前沿水平。
这个定位很关键。
它不是说开源已经全面赢了,而是说比较方式变了。Kimi K3 的意义不在于某一项榜单分数,而在于:开源模型第一次在很多人关心的任务上,接近了“可以认真比较”的位置。
过去是“闭源能做,开源不能做”。现在越来越多任务变成“闭源做得更好,但开源也能做,而且便宜很多”。
商业压力往往不是从第一名开始的,而是从“够用的第二选择”开始的。
二、这就是斩杀线
如果说 Kimi K3 更多是在能力维度把开源模型抬进第一梯队,那 DeepSeek V4 Flash 更像是在成本维度把门槛压下来。
在一份长期私有测评榜单中,DeepSeek V4 Flash 0731 的推理分数没有排到最前面,但它的测试成本非常刺眼:同一张表里,GPT-5.5 测试成本是百元级,Kimi K3 也是百元级,DeepSeek V4 Flash 0731 只有个位数。

当模型进入 Agent 任务后,成本不再是附带指标,而是能力的一部分。
因为 Agent 和聊天不一样。
聊天是一次回答,Agent 是连续行动。它会读文件、跑命令、调用工具、看结果、再决定下一步。一旦任务链路变长,token 消耗、工具调用、失败重试和上下文续接都会放大成本。
在这个场景里,一个模型便宜一点,不只是账单好看。
它意味着你敢不敢让它多试几轮,敢不敢让它跑夜间任务,敢不敢把它放进日常开发工作流里。
更重要的是,这不是只停留在一张榜单里。
OpenRouter 的公开数据显示,DeepSeek V4 发布后,其 token 份额从年初的约 9% 翻倍到 6 月初的近 20%——而 token 份额增长远超其支出份额增长,因为太便宜了,同样的钱能消耗更多 token。TechNode 报道也证实,V4 Flash 在 7 月最后一周处理了 7.22 万亿 token。
性价比已经在驱动真实采用,而不是只驱动围观。
DeepSeek 这次更新的重点也正在这里。
DeepSeek 官方更新日志写明,V4-Flash 0731 强化了 Agent 能力,在多个主流编程 Agent 基准测试中刷新成绩,并针对 Codex 做了原生适配。DeepSeek 甚至提供了一键配置方案,让开发者可以在几分钟内把 Codex 的模型提供商从 OpenAI 切换到 DeepSeek,迁移成本几乎为零。
这说明它不是只在聊天框里便宜,而是在试图接入开发者真实工作流。
不过,便宜不等于永久便宜。
DeepSeek 官方价格页已经提示:未来会整体提高 API 服务价格,而且预计涨幅显著,具体价格方案以后续官方通知为准。
这条提示很重要。它不是把这篇文章的判断推翻了,反而把问题说得更清楚:DeepSeek 的低价不是一个永恒承诺,而是一次价格锚点重置。
它先让开发者看到,Agent 任务原来可以用更低成本跑起来;随后即便涨价,用户心里的参照系也已经变了。闭源模型不能再只用“我更强”解释溢价,开源和低价模型也不能只用“我更便宜”维持吸引力。即便未来涨价,讨价还价的主动权也已经转移——接下来真正要比较的是:每一档价格背后,到底买到了什么确定性、工具适配、上下文管理和稳定体验。
开源模型真正打闭源模型的地方,可能不是“我在榜单上高你 0.5 分”,而是:
我让你原来舍不得跑的任务,变成可以认真算账。
所谓“斩杀线”,不是谁排第一。
它是一个商业阈值:
当更开放、价格可比的选择在大多数日常任务里够用且可信,闭源的高溢价就会被迫重新解释。
这条线一旦出现,用户心里的问题会发生变化。
过去用户问:
哪个模型最强?
现在用户会先问:
这个任务真的需要最强吗?
这是两个完全不同的问题。
第一个问题有利于闭源模型。因为只要第一名足够耀眼,用户就会默认往第一名靠。
第二个问题有利于开源模型。因为大多数真实任务并不总是需要第一名。它们需要的是稳定通过、价格可控、能接工具、能批量跑、能被自己掌控。
所以 DeepSeek 预告涨价之后,这条线也没有消失。
因为斩杀线从来不是“永远两块钱”。它真正改变的是比较方式:用户开始把能力、价格、开放性和工作流绑定在一起算总账。
一旦用户开始按任务分层,闭源模型就会失去一部分默认流量。
最强模型仍然会留在最高风险、最高价值、最高不确定性的场景里。 但大量中低风险任务会被拆出去,如资料整理、代码初稿、测试生成、批量改写、数据清洗、日常 Agent 流程。
这些任务过去可能都被闭源订阅包住。
现在,它们开始有了替代路线。
三、过去卖模型能力,现在卖留下来的理由
所以你会看到另一个变化:闭源平台开始重新经营默认选择权。
OpenAI 一边把 GPT Luna 放进免费入口,一边下调 Luna / Terra 的价格,并把这种成本变化反映到 Codex 和 ChatGPT Work 的用量计量里;Anthropic 也在 Fable 5 短暂暂停后恢复访问。
更强能力被放进更低门槛的入口,订阅权益的边界正在反复调整。
这些现象不必强行归因于某一家竞争对手。
更稳的判断是:当开源模型越过够用线,闭源平台不能只卖“模型更强”,它还要卖“为什么你应该继续留在这里”。
第一,Agent 时代的用户不是一天问几十次,而是让模型连续跑任务。限制太紧,重度用户会被迫寻找替代品。
第二,一旦用户把 Kimi、DeepSeek、Qwen、本地推理服务、开源 Agent 框架接起来,迁移成本就会反过来变高。闭源厂商最怕的不是用户今天省了一点钱,而是用户明天养成了不用它的工作流。
第三,价格战已经从 API 进入产品体验层。闭源模型不能只说自己更强,还要让用户感到“我留在这里更省心”:更多额度、更少打断、更稳定的任务状态、更好的上下文管理、更少莫名其妙的风控误伤。
过去闭源卖的是模型能力。
现在,它开始卖留下来的理由。
四、闭源还剩什么
闭源模型当然还有价值。
但从现在开始,它的价值必须被证明,而不能被默认。
闭源模型真正有价值的地方,可能会从“单点模型分数”退到更靠后的几层:
- 稳定性:关键任务能不能少掉链子;
- 体验:多端、上下文、文件、项目、记忆和工具链能不能顺;
- 生态:IDE、办公软件、企业系统、插件市场能不能接好;
- 信任:数据边界、合规、审计、赔付和责任归属能不能说清楚;
- 品牌:用户在高风险场景里愿不愿意把结果交给它。
这些东西都很值钱。
但它们不是“默认值钱”。
开源模型把闭源模型从神坛上拉回了交易桌。你可以贵,但你要说明贵在哪里。你可以闭源,但你要给我省掉足够多的麻烦。你可以限制使用,但你不能把重度用户逼去重建一套自己的工作流。
这就是开源模型现在最锋利的地方。
它不是一定要在每个 benchmark 上拿第一。
它只要在足够多任务上过线,就会改变定价权。
结尾
开源模型不再只是追赶者。
它开始变成闭源模型商业化的压力测试。
Kimi K3 问的是:开源模型的上限到底能到哪里?
DeepSeek V4 Flash 问的是:如果 Agent 任务可以用更低成本跑起来,闭源订阅还凭什么维持原来的溢价?
最终被改变的,不只是模型排行榜。
而是用户第一次有底气问:
如果 80 分的能力已经足够完成任务,90 分的能力凭什么维持原来的溢价?
现在,轮到闭源模型报价了。
