中文

基于置信动力学的大规模推理模型早停策略

计算与语言 2026-04-07 v1 人工智能 机器学习

摘要

大规模推理模型依赖长链式思维生成以解决复杂问题,但扩展的推理往往造成巨大的计算成本,甚至因过度思考而降低性能。关键挑战在于确定模型何时应该停止推理并生成最终答案。本文研究了推理过程中中间答案的置信度,并观察到两种特征行为:正确的推理轨迹往往很早就达到高置信度答案,而不正确的推演则倾向于产生长时间且毫无收益的推理痕迹,并表现出置信度动力学不可靠。针对这些观察,我们提出了 CoDE-Stop(置信动力学早停),一种利用中间答案置信度动力学决定何时终止推理的早停方法,无需额外训练即可轻松集成到现有模型中。我们在多种推理和科学基准测试中评估了 CoDE-Stop。与先前的早停方法相比,它在准确率与计算量之间取得更佳的权衡,并将总token使用量降低了 25-50%。此外,我们提供了关于推理过程中置信度动力学的分析,深入探讨了正确轨迹和不正确轨迹中置信度的变化方式。

关键词

引用

@article{arxiv.2604.04930,
  title  = {Early Stopping for Large Reasoning Models via Confidence Dynamics},
  author = {Parsa Hosseini and Sumit Nawathe and Mahdi Salmani and Meisam Razaviyayn and Soheil Feizi},
  journal= {arXiv preprint arXiv:2604.04930},
  year   = {2026}
}