中文

THOUGHTTERMINATOR:衡量、校准与缓解推理模型中的过度思考

计算与语言 2025-04-21 v1

摘要

推理模型在传统语言模型难以应对的难题上表现出色。然而,许多模型都受到过度思考的困扰——生成大量不提高问题准确率的多余标记。我们引入问题难度的近似度量,展示了问题难度与最优标记消耗之间存在明确关系,并评估了各种推理模型在有效分配最优标记数量方面的校准情况。我们发现,总体而言,推理模型校准得不太好,尤其是在容易的问题上。为评估容易问题上的校准,我们引入了DUMB500,一个包含极易数学、推理、代码和任务问题的数据集,并在同一任务领域中对这些简单问题以及来自现有前沿基准的极难问题进行联合评估。最后,我们引入了THOUGHTTERMINATOR,这是一种无训练的黑盒解码技术,显著改善了推理模型的校准。

关键词

引用

@article{arxiv.2504.13367,
  title  = {THOUGHTTERMINATOR: Benchmarking, Calibrating, and Mitigating Overthinking in Reasoning Models},
  author = {Xiao Pu and Michael Saxon and Wenyue Hua and William Yang Wang},
  journal= {arXiv preprint arXiv:2504.13367},
  year   = {2025}
}