中文

长推理痕迹中的回溯激增:探究过度思考的形态

人工智能 2026-05-28 v1

摘要

推理模型常生成长痕迹,其中有用的自我纠正与无效的修订难以区分。我们通过回溯动力学来研究这种区分:在长形式推理痕迹中的局部重新考虑、撤回或重新推导。在 6000 条 Qwen3-8B AIME 推理痕迹上,我们对段落级别的回溯严重程度进行了标注,并分析了事件时间、归一化深度和局部激增结构。我们发现,早期孤立的修复往往与正确的推理相容,而错误的推理痕迹更常表现为持续性和集中于晚期的中度至严重回溯。跨语料库的检查显示,相同质量的不对称在其他模型/领域对之间也存在。过滤分析将该信号实例化为前缀因果选择性早期退出策略:在浅层和中等深度,激增感知的过滤在仅使用前缀可用特征的情况下优于固定长度的过滤,而中等长度的截断仍是强大的已完成痕迹基线,但激增感知的控制提供了一种可部署的机制,用于区分可恢复的修复与可能的不稳定性。

关键词

引用

@article{arxiv.2605.27965,
  title  = {The Shape of Overthinking: Backtracking Bursts in Long Reasoning Traces},
  author = {Navid Rezazadeh and Arash Gholami Davoodi},
  journal= {arXiv preprint arXiv:2605.27965},
  year   = {2026}
}