中文

停止即足够:链式思考推理的自适应早停

计算与语言 2025-10-14 v1

摘要

链式思考(CoT)推理已推动大型语言模型(LLM)在推理密集型任务上的最新进步,通过外部化中间步骤实现。然而,过度或冗余的推理——即所谓的过度思考——会增加推理成本并导致LLM走向错误结论。本文提出REFRAIN(\underline{REF}lective-R\underline{R}edundancy for A\underline{A}daptive IN\underline{IN}ference),一个无需训练的框架,自适应地确定何时停止推理以缓解过度思考。REFRAIN集成了一个两阶段停止判别器,用于识别反思性且冗余的推理,以及一个基于滑动窗口上置信界(SW-UCB)的多臂老虎机控制器,用于在无监督或微调的情况下根据问题难度动态调整停止阈值。我们在四个代表性基准和两个模型家族上进行实验,REFRAIN在保持或提高准确率的同时,将token使用量降低了20%-55%。广泛的消融和鲁棒性分析表明,其在模型、评分器和提示变体间具有稳定性。总之,我们的发现表明何时停止是一种新的且实用的测试时间扩展轴——使模型不仅能推理更多,更能推理恰到好处。

关键词

引用

@article{arxiv.2510.10103,
  title  = {Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning},
  author = {Renliang Sun and Wei Cheng and Dawei Li and Haifeng Chen and Wei Wang},
  journal= {arXiv preprint arXiv:2510.10103},
  year   = {2025}
}