CODEX RESET RADAR Codex 重置雷达
EN
INSIGHTS · 模型与性能

agent loop 逆向笔记:reasoning tokens 的生命周期

更新:2026-09-20约 3 分钟来源 × 1

TL;DR把代理循环展开看,Codex 的一次任务是一圈圈「模型→工具→回填」的循环。社区逆向分析的焦点是 reasoning tokens 的生命周期:任务内跨工具调用保持连续、任务结束被丢弃。这条结论解释力很强,但仍属待验证的社区分析。

来源信号 SOURCES

以下内容整理自社区公开讨论,本页只做拆解与核实,不搬运原帖;观点归属原作者。

事实性知识 FACTS

这些是讨论中被多方印证、或可对照官方文档核实的事实。

概念性知识 CONCEPTS

社区讨论里的概念不全是事实——每条都标注了它的性质,读之前先看标签。

agent loop已验证事实

编码代理的基本运行结构:模型读上下文生成动作,调用工具(读写文件、跑命令),把结果回填上下文,再进入下一轮,直到任务完成。

reasoning token已验证事实

模型在产出可见回答之前内部「思考」所消耗的 token,通常不直接展示给用户,但参与计费与上下文组织。

跨调用持续、结束即弃待验证假设

社区逆向分析的结论:一次任务内,reasoning tokens 跨多次工具调用保持连续;任务结束后这批推理即被丢弃,不带入下一个任务。该结论来自单一分析、未经官方复现,请按假设对待。

为什么它有解释力个人观点

若该结论成立,它能解释两类日常现象:长任务中模型的「思路」为什么显得连贯,以及为什么每个新任务都要重新热身。这是社区分析者层面的推断,不是官方说明。

知识梳理 TAKEAWAYS

这场讨论最值得学的不是结论而是手法:把黑盒展开成时间线,逐圈标注每一步进出上下文的东西。做完这一步,很多「玄学」会自动变成机制问题——这也是我们把它归入性能研究线的原因。

对日常使用的推论要克制。如果「结束即弃」属实,把大任务拆小会付出推理连续性的代价,拆与不拆之间需要权衡;但由于结论未经复现,不值得据此大改工作流,知道有这个变量即可。

它和 518 聚类研究放在一起看很有意思:一个盯 token 的空间分布,一个盯 token 的时间生命周期,都是社区在官方文档之外自建的解释框架。阅读姿态可以一致——方法可学,结论存疑,等复现。

想知道今天的重置判定?回到 首页实时雷达

🎯 今天该猛蹬还是省着蹬?
打开实时雷达:按 53 场历史重置规律推算下一次全员重置窗口,官方官宣即刻切换为准确时间。
打开实时雷达 →