中文

有效推理的特征是什么?重新审视 CoT 的长度、审查与结构

机器学习 2025-09-24 v1

摘要

大型推理模型(LRMs)在长思维链(CoT)轨迹上耗费了大量的测试时计算,但什么*表征*了有效的 CoT 仍不清楚。尽管先前的工作报告了通过附加 *wait* token 来延长 CoT 和增加审查(重访早期步骤)所带来的增益,但最近的研究表明,更短的思考可以胜过更长的轨迹。因此,我们在十个 LRMs 上对数学和科学推理进行了系统评估。与“越长越好”的说法相反,我们发现朴素的 CoT 延长和增加的审查都与*更低*的准确率相关。随着 CoT 逐步展开,token 级别的指标可能会将冗长与过程质量混淆。我们引入了 CoT 的图视图来提取结构,并确定了一个单一的统计量——*失败步骤比例(FSF)*,即废弃分支中步骤所占的比例——它在跨模型预测正确性方面始终优于长度和审查比例。为了探究因果关系,我们设计了两种干预措施。首先,我们在测试时根据每个指标对候选 CoT 进行排序,其中 FSF 产生了最大的 pass@1 增益;其次,我们编辑 CoT 以移除失败的分支,这显著提高了准确率,表明失败的分支会偏误后续推理。总而言之,这些结果将有效的 CoT 表征为那些*失败更少*的 CoT,并支持*结构感知*的测试时扩展,而非不加区分地生成长 CoT。

关键词

引用

@article{arxiv.2509.19284,
  title  = {What Characterizes Effective Reasoning? Revisiting Length, Review, and Structure of CoT},
  author = {Yunzhen Feng and Julia Kempe and Cheng Zhang and Parag Jain and Anthony Hartshorn},
  journal= {arXiv preprint arXiv:2509.19284},
  year   = {2025}
}