2025年11月7日,中国大模型公司月之暗面(Moonshoot)发布了Kimi K2 Thinking模型。Kimi K2 Thinking是一款MoE架构的推理模型,总参数1T,每次激活参数为32B。
然而——从模型本身能力提升的角度,Kimi K2 Thinking 是巨大的成功。从商业化的角度,却是失败的。
Kimi K2 Thinking 模型本身能力来看,开源总参数1T、激活参数32B的大模型,多项测试跑分逼近GPT 5、Claude 4.5这样的前沿模型,是国产模型的新突破、新高度。
但从商业化的角度,过慢的推理速度,过高的价格,使得 K2 Thinking 商业上的使用价值被大幅度稀释。
K2 Thinking本身有两个推理的API端点,在OpenRouter上就看得很清楚。普通版,价格 0.6 / 2.5 美元,速度在20 token/s。另一个是K2 Thinking Turbo,价格是1.15 / 8 美元,速度在 60 token/s。

如果你对比一下Claude 4.5,价格是 3/15 美元;GPT 5是 1.25 / 10 美元。OpenAI和Anthropic这两家前沿模型的输出速度都在60 token/s以上。K2 Thinking低速版的价格还能说便宜了4倍左右,但如果你把输出速度拉齐以后,价格优势就消失了。
这就导致非常尴尬的问题出现,K2 Thinking 在经济上使用的价值大幅度缩水。用知乎 tayama nao 的榜单来看就很明显,这个评测用的应该是低速版API,而不是更贵的Turbo。
GPT 5 mini,总体分数高于K2 Thinking,中位数差距更小代表GPT 5 mini输出的答案更加稳定。K2 Thinking用时1195秒,是GPT 5 mini用时的6倍以上;测试成本10人民币,还高于GPT 5 mini。
GPT 5 mini推理逻辑能力更强,输出更稳定,价格更便宜,速度更快。我有什么理由不用GPT 5 mini呢?

chenqin 之前的回答就提到了为什么GPT 5 mini是OpenAI真正有性价比的大杀器。可以参考阅读: deepseek r1发布后的十个月,中美AI大模型之间的差距为什么拉大了(个人使用感觉)?
Deepseek R1当时能够获得成功,靠的是真正低一个数量级的价格实现相似的模型能力,即便速度慢一些,大家也就忍了。
而时间到了现在,比较悲哀的是,似乎是国产模型突出的亮点越来越少,价格也逐渐贵了起来,经济价值大幅度缩水。你看上面这个榜单,GPT OSS 120B中位分数和Deepseek V3.2相似,实际价格比Deepseek V3.2还要便宜,速度快了10倍。
大模型发展到现在,早就不是靠几个榜单和指标就能赢的了。API也不是只看单价。综合来看,应用程序功能是否丰富,API结合思考token量之后的实际价格究竟是多少,速度能否达到平衡点。
至于说1T总参数的模型开源,也只有象征意义。1T总参数,int 4下显存占用会有500多G。你本地部署需要8卡H20,超过100万的成本,够API用10年都用不完,更不要说模型还要迭代了。

发表评论