开源模型和闭源前沿模型,差距究竟有多大?

不少用户都很好奇,开源模型比GPT 5、Claude 4.5、Gemini 3 Pro这类闭源前沿模型,还有差距吗?如果仅仅从 benchmark 来看,似乎 Deepseek V3.2 已经完全和 GPT 5 在同一水平线上。

然而从Deepseek 发布 V3.2 正式版的技术报告当中,我们还是能够找到不少蛛丝马迹,至少有两个点揭示了差距之大。

第一个是技术报告里面对老版本 V3.2 Exp 做的一个benchmark。

Deepseek内部通用综合Agent任务,老的 V3.2 Exp 在Pass1只有12%,4次尝试只有26%;作为对比,Claude Sonnet 4.5 的pass 1就能得分34%,要知道Claude完全是“跑分没赢过,体验没输过的”。

如果我不把这个分数摘出来看,很多人只看大面上的benchmark,V3.2 Exp不是和GPT 5“差距不大”么,现在V3.2正式版进一步提高完全逼近 GPT 5.1了,还便宜30倍,那不是彻底赢了么。

实际情况是,你能找到的市面上公开benchmark,在不刷分的前提之下可以想办法通过SFT、RL、ReFT把成绩提高上去,最终控制的和GPT 5.1差不多。但是在没有benchmark指导的领域,这些差距都是真实存在的,并且极度影响用户体验的。

回顾一下小米手机经历过的“跑分没输过”阶段,可以类比一下。拿我更熟悉的笔记本电脑领域,把性能释放拉高了以后,风噪有没有控制住,风扇启停策略能不能不干扰用户,键盘表面温度是不是烫手。这些指标很难在跑分上体现,但是极度影响用户体验。

第二个就是之前 Kimi K2 Thinking 我就指出的问题。CoT太长,极度影响用户体验,思考token也是要钱的。V3.2 Speciale模型的思维链几乎长了一倍,而且不支持工具调用,只能引起少数看客的欢呼,在商业使用上没有价值。

文末Deepseek自己也承认了这一点,未来要缩减思维链长度。文末承认了世界知识、思维链长度、复杂任务能力三大差距。

世界知识上,SimpleQA 在Gemini 3 Pro是70分,GPT 5.1是50分,而Deepseek整个V3系列大致是30分左右。差距已经拉开了。所谓节省算力600万美元训练出前沿模型,只是神话。


已发布

分类

,

来自

评论

发表评论

了解 AI前哨 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读