体验:GPT 5.1 Instant 不爱说话

OpenAI 发布的 GPT 5.1 系列模型,包括了 GPT 5.1 Instant 和 GPT 5.1 Thinking 两个不同的模型,在API当中的checkpoint分别对应 gpt-5.1-chat-latest 和 gpt-5.1。

非常有趣的一点是,GPT 5.1 Instant 模型回复极为简洁,似乎不太喜欢说话。笔者提问 “可乐可以除水垢吗”,GPT 5.1 Instant回复仅寥寥数语。

同样的问题扔给GPT 5.1,GPT 5.1的回复则包括了可乐为什么能除水垢、实际效果如何、有哪些问题和隐患、更推荐的除水垢方法、日常小建议和总结。

GPT 5.1 Instant回复极为简洁
GPT 5.1 Thinking回复明显更为详细

由此可见,同样属于GPT 5.1系列,两个模型有着完全不同的回答风格。GPT 5.1 Instant主打简洁风格,正如其名Instant,让用户获得近乎实时的回答。GPT 5.1 Thinking则深思熟虑,给出了一个详细分析了前因后果。

笔者尝试将“可乐可以除水垢吗?”这个问题,提给了市面上的不同模型,统计其回复的 token 数量,绘制表格,量化表征了不同模型的啰嗦程度(verbosity)。

模型回复长度(token)
GPT 5.1 Instant115
GPT 5.1 Thinking1185
GPT 5 Chat464
GPT 5 Thinking605
GPT 5 mini600
Claude Opus 4.5225
Claude Sonnet 4.5325
Claude Haiku 4.5334
Gemini 3 Pro863
Gemini 2.5 Pro3302
Deepseek V3.2 Thinking1182
Deepseek V3.2835
GPT-OSS-120B1572
GPT 4.1452
GPT 4o-1120512
Qwen3-225B-2507534

由于模型输出的token也是要计价的,模型真实使用成本并不能只看单价,而是输出长度和单价的成绩。

Gemini 2.5 Pro最为啰嗦,包含了思考过程的总token消耗达到了3000以上,回复token为1572。新款Gemini 3 Pro则降低到了862 token。

GPT-OSS-120B第二啰嗦,输出长度达到了1572 token。其回复中列出了化学反应式和多个对比表格,可以说是事无巨细。

OpenAI的模型分化明显。GPT 5.1 Thinking回复超过1000 token,而GPT 5.1 Instant仅为115 token。

Claude模型全系都保持了简洁,仅回复了200-300 token。

笔者这个实验仅问了一个问题,当然存在很大的不严谨。但是对于用户日常提问,是选择详细的阐述,还是简洁的回复,对于体验的影响是很大的。

  • 不少服务提供商回复速度很慢,一个简单的可乐能否除水垢,需要等待半分钟才能够完全回答完毕。
  • 如果回答很长,用户在手机和网页等界面,更是需要多次滚动页面,也会影响体验。

未来,笔者或将建立类似的评测数据集,收集日常生活小常识的提问数据集,从而综合反映出模型回复详细程度。

更新通知

本页面仅探讨了GPT 5.1 Instant的Verbosity问题。大语言模型啰嗦程度数据集已经搬迁至 LLM Verbosity Dataset ,该数据集网页会实时更新。


已发布

分类

来自

评论

发表评论

了解 AI前哨 的更多信息

立即订阅以继续阅读并访问完整档案。

继续阅读