OpenAI 发布的 GPT 5.1 系列模型,包括了 GPT 5.1 Instant 和 GPT 5.1 Thinking 两个不同的模型,在API当中的checkpoint分别对应 gpt-5.1-chat-latest 和 gpt-5.1。
非常有趣的一点是,GPT 5.1 Instant 模型回复极为简洁,似乎不太喜欢说话。笔者提问 “可乐可以除水垢吗”,GPT 5.1 Instant回复仅寥寥数语。
同样的问题扔给GPT 5.1,GPT 5.1的回复则包括了可乐为什么能除水垢、实际效果如何、有哪些问题和隐患、更推荐的除水垢方法、日常小建议和总结。


由此可见,同样属于GPT 5.1系列,两个模型有着完全不同的回答风格。GPT 5.1 Instant主打简洁风格,正如其名Instant,让用户获得近乎实时的回答。GPT 5.1 Thinking则深思熟虑,给出了一个详细分析了前因后果。
笔者尝试将“可乐可以除水垢吗?”这个问题,提给了市面上的不同模型,统计其回复的 token 数量,绘制表格,量化表征了不同模型的啰嗦程度(verbosity)。
| 模型 | 回复长度(token) |
| GPT 5.1 Instant | 115 |
| GPT 5.1 Thinking | 1185 |
| GPT 5 Chat | 464 |
| GPT 5 Thinking | 605 |
| GPT 5 mini | 600 |
| Claude Opus 4.5 | 225 |
| Claude Sonnet 4.5 | 325 |
| Claude Haiku 4.5 | 334 |
| Gemini 3 Pro | 863 |
| Gemini 2.5 Pro | 3302 |
| Deepseek V3.2 Thinking | 1182 |
| Deepseek V3.2 | 835 |
| GPT-OSS-120B | 1572 |
| GPT 4.1 | 452 |
| GPT 4o-1120 | 512 |
| Qwen3-225B-2507 | 534 |
由于模型输出的token也是要计价的,模型真实使用成本并不能只看单价,而是输出长度和单价的成绩。
Gemini 2.5 Pro最为啰嗦,包含了思考过程的总token消耗达到了3000以上,回复token为1572。新款Gemini 3 Pro则降低到了862 token。
GPT-OSS-120B第二啰嗦,输出长度达到了1572 token。其回复中列出了化学反应式和多个对比表格,可以说是事无巨细。
OpenAI的模型分化明显。GPT 5.1 Thinking回复超过1000 token,而GPT 5.1 Instant仅为115 token。
Claude模型全系都保持了简洁,仅回复了200-300 token。
笔者这个实验仅问了一个问题,当然存在很大的不严谨。但是对于用户日常提问,是选择详细的阐述,还是简洁的回复,对于体验的影响是很大的。
- 不少服务提供商回复速度很慢,一个简单的可乐能否除水垢,需要等待半分钟才能够完全回答完毕。
- 如果回答很长,用户在手机和网页等界面,更是需要多次滚动页面,也会影响体验。
未来,笔者或将建立类似的评测数据集,收集日常生活小常识的提问数据集,从而综合反映出模型回复详细程度。
更新通知
本页面仅探讨了GPT 5.1 Instant的Verbosity问题。大语言模型啰嗦程度数据集已经搬迁至 LLM Verbosity Dataset ,该数据集网页会实时更新。

发表评论