将答案收敛作为推理中早停的信号
计算与语言
2025-09-30 v2
摘要
思维链(CoT)提示增强了大型语言模型(LLM)的推理能力,但常导致输出冗长且冗余,从而增加推理成本。我们假设许多推理步骤对于产生正确答案是多余的。为了验证这一点,我们从一项系统性研究开始,考察模型达到稳定决策所需的最少推理量。我们发现在数学等数学推理任务上,模型通常在 60% 的推理步骤后即收敛至最终答案,表明剩余内容存在大量冗余。基于这些发现,我们提出了三种推理时提升效率的策略:(1) 基于答案一致性的早停,(2) 提升生成推理结束信号的概率,以及 (3) 一种基于内部激活学习何时停止的监督方法。在五个基准测试和五个开放权重 LLM 上的实验表明,我们的方法显著减少了 token 使用量,且准确率几乎没有或完全没有下降。特别是在 NaturalQuestions 上,答案一致性将 token 减少了 40% 以上,同时进一步提高了准确率。我们的工作强调了在推理时运行的高效推理方法的重要性,为实际应用提供了实用效益。
引用
@article{arxiv.2506.02536,
title = {Answer Convergence as a Signal for Early Stopping in Reasoning},
author = {Xin Liu and Lu Wang},
journal= {arXiv preprint arXiv:2506.02536},
year = {2025}
}