中文

TERMINATOR:学习链式思考推理中最优退出点的早期停止策略

机器学习 2026-05-15 v2 人工智能 计算与语言

摘要

大规模推理模型(LRM)通过链式思考(CoT)推理在复杂推理任务上取得显著性能,该推理使其在得出最终答案之前生成中间思考标记。然而,LRM 常常存在显著的过思考问题,即使答案已早早生成,仍会消耗过多的计算资源。先前研究识别出存在最优推理长度,可在该点截断推理显著缩短 CoT 输出,几乎不影响性能。然而,确定实际数据集的最优 CoT 长度高度具备依赖性,因为它们完全取决于具体任务和模型。在本文中,我们精确地解决了这一问题,设计了 Terminator 作为 LRM 在推理时的早期退出策略以缓解过思考问题。Terminator 的核心思想是 LRM 最终答案的第一次到达往往是可预测的,我们利用这些第一次答案位置创建了最优推理长度的新型数据集以训练 Terminator。凭借这一方法,Terminator 在四个具有挑战性的实际数据集上(MATH-500、AIME 2025、HumanEval 和 GPQA)实现了 CoT 长度平均降低 14%-55%,同时超越当前最先进方法,较原始 LRM 推理延迟降低超过 2 倍。

关键词

引用

@article{arxiv.2603.12529,
  title  = {TERMINATOR: Learning Optimal Exit Points for Early Stopping in Chain-of-Thought Reasoning},
  author = {Alliot Nagle and Jakhongir Saydaliev and Dhia Garbaya and Michael Gastpar and Ashok Vardhan Makkuva and Hyeji Kim},
  journal= {arXiv preprint arXiv:2603.12529},
  year   = {2026}
}

备注

Updated and reorganized results. Added new results