停止即足够:链式思考推理的自适应早停
计算与语言
2025-10-14 v1
摘要
链式思考(CoT)推理已推动大型语言模型(LLM)在推理密集型任务上的最新进步,通过外部化中间步骤实现。然而,过度或冗余的推理——即所谓的过度思考——会增加推理成本并导致LLM走向错误结论。本文提出REFRAIN(\underline{REF}lective-edundancy for daptive ference),一个无需训练的框架,自适应地确定何时停止推理以缓解过度思考。REFRAIN集成了一个两阶段停止判别器,用于识别反思性且冗余的推理,以及一个基于滑动窗口上置信界(SW-UCB)的多臂老虎机控制器,用于在无监督或微调的情况下根据问题难度动态调整停止阈值。我们在四个代表性基准和两个模型家族上进行实验,REFRAIN在保持或提高准确率的同时,将token使用量降低了20%-55%。广泛的消融和鲁棒性分析表明,其在模型、评分器和提示变体间具有稳定性。总之,我们的发现表明何时停止是一种新的且实用的测试时间扩展轴——使模型不仅能推理更多,更能推理恰到好处。
引用
@article{arxiv.2510.10103,
title = {Stop When Enough: Adaptive Early-Stopping for Chain-of-Thought Reasoning},
author = {Renliang Sun and Wei Cheng and Dawei Li and Haifeng Chen and Wei Wang},
journal= {arXiv preprint arXiv:2510.10103},
year = {2025}
}