TL;DR从 GPT-5.2 到 5.6,每次发布都伴随基准数字与高热争论。这篇不给排名,给读法:把基准信息分成三层各取所需,用四个问题快速体检任何一份跑分,再用自己仓库的最小任务做个人校准。
来源信号 SOURCES
以下内容整理自社区公开讨论,本页只做拆解与核实,不搬运原帖;观点归属原作者。
事实性知识 FACTS
这些是讨论中被多方印证、或可对照官方文档核实的事实。
- 模型发布的 HN 热度量级可以直接说明基准讨论的规模:GPT-5.3-Codex 发布帖 1530 分、605 条评论(2026-02),GPT-5.2-Codex 发布帖 589 分、318 条评论(2025-12)。
- 按官方产品线锚点,模型线从 2025-09 的 GPT-5-Codex 快速推进到 2026-07 的 5.6 Sol Ultra——几乎每轮发布都附带新一轮基准数字。
- 社区对模型的日常体验并不总与跑分同调:同一时期 HN 372 分的讨论关注的正是「跑分之外」的日常波动(reasoning token 聚类与质量阶跃假设,现象未经官方复现)。
- 基准分衡量的是特定测试集上的表现;测试集与真实任务之间的差异,是所有跑分讨论共同的软肋。
概念性知识 CONCEPTS
社区讨论里的概念不全是事实——每条都标注了它的性质,读之前先看标签。
在固定测试集上按固定口径算出的分数。它擅长回答「在别人的题上谁高」,不直接回答「在我的任务上谁好用」。
官方发布数字(有数据但选择性呈现)→ 可复现的第三方评测(方法透明但覆盖有限)→ 个人体感(最弱的证据但与你最相关)。可信度与相关性按此序反向排列,这是本站的分层建议。
同一模型换测试集、换评分脚本、换采样参数,名次都可能变。所以「哪个模型更强」脱离口径就没有意义。
发布方倾向于展示有利基准,这是传播规律使然而非阴谋;对策不是不信,而是每次都追问没展示的那部分。
知识梳理 TAKEAWAYS
四个体检问题,读任何跑分前先过一遍:跟谁比(基线是什么模型、什么配置);怎么测(测试集与评分脚本是否公开);样本多大(单次运行还是多次平均);谁发布(利益相关方还是第三方)。四个问题答不上来的跑分,只配当传闻。
把基准分当筛选器,别当排行榜。发布周的关注点应该收窄为:新模型有没有在我关心的能力带上跳档。头部模型之间的分差,落到具体任务上经常不可分辨——这时候决定体验的是档位、上下文准备这些下游变量,不是榜上前几名之间的小数点级差距。
个人校准是最后的锚:在自己的仓库里留一组最小任务(一个典型 bug 修复、一次典型重构、一个长链路任务),新模型发布时原样跑一遍。十分钟的个人基准,比任何第三方榜单都更接近你的真实收益。
看完之后 NEXT
想知道今天的重置判定?回到 首页实时雷达。