何时可以节省思考?对大规模推理模型行为差异的机理分析
人工智能
2025-05-22 v1 计算与语言
摘要
大规模推理模型 (LRM) 已显著提升复杂任务性能,但倾向于“过度思考”,导致效率低下。本研究探讨了经过强化学习训练的 LRM 在被要求节省思考时的内部机制,揭示了三种不同的思考模式:不思考 (NT)、显式思考 (ET) 和隐式思考 (IT)。通过全面分析思考终止置信度、从思考到生成的注意力,以及输入部分的注意力聚焦,我们发现影响推理行为的关键因素。进一步发现,NT 在缩短输出长度方面以牺牲准确率为代价,而 ET 和 IT 在保持准确率的同时实现响应长度缩减。我们的发现暴露了 RL 优化型 LRM 的根本性不一致性, necessitating 对可靠的效率提出自适应改进的需求。
引用
@article{arxiv.2505.15276,
title = {When Can Large Reasoning Models Save Thinking? Mechanistic Analysis of Behavioral Divergence in Reasoning},
author = {Rongzhi Zhu and Yi Liu and Zequn Sun and Yiwei Wang and Wei Hu},
journal= {arXiv preprint arXiv:2505.15276},
year = {2025}
}