中文

缺失前提加剧过度思考:推理模型是否失去关键思考技能?

人工智能 2025-04-14 v2 计算与语言 机器学习

摘要

我们发现,无论是通过强化学习还是监督学习训练的推理大语言模型(LLM),对于缺失前提(MiP)的错误问题,其响应长度大幅增加,导致冗长且无效的思考。这种新引入的场景在一定程度上加剧了普遍的过度思考问题,这一现象我们称为 MiP-过度思考。尽管违反了“测试时规模定律”,但我们在多个包含 MiP 的数据集上广泛观察到这一现象,表明廉价的过度思考以及缺乏关键性思考有何危害。意外的是,我们注意到,专门用于推理训练的大语言模型在 MiP 场景下表现更差,而那些未专门训练用于推理的大语言模型则表现出更好的表现,能够产生更简短的响应,迅速识别出问题的前提缺失。这表明当前为推理大语言模型的训练配方存在关键缺陷,即不足以鼓励高效思考,导致滥用思考模式。为进一步探讨这类失败的原因,我们对不同类型的大语言模型的推理长度、过度思考模式以及关键性思考位置进行了细粒度分析。此外,我们的扩展消融研究揭示,过度思考会通过推理模型响应的蒸馏传播。这些结果改进了对过度思考的理解,并为解决该问题提供了新视角。

关键词

引用

@article{arxiv.2504.06514,
  title  = {Missing Premise exacerbates Overthinking: Are Reasoning Models losing Critical Thinking Skill?},
  author = {Chenrui Fan and Ming Li and Lichao Sun and Tianyi Zhou},
  journal= {arXiv preprint arXiv:2504.06514},
  year   = {2025}
}