通过推理塑形缓解过度思考
计算与语言
2025-10-13 v1 人工智能
摘要
由验证器奖励强化学习(RLVR)驱动的大型推理模型(LRMs)在问题求解方面展现出强大能力,但它们常常导致过度思考:过度、迂回的推理过程增加了计算成本。RLVR中先前的惩罚设计虽然能够减少token消耗,但往往损害模型性能,这源于token级监督的过于简单。在本文中,我们论证了监督粒度在平衡效率与准确性方面的关键作用,并提出了组相对片段惩罚(GRSP),一种片段级正则化方法。由于初步分析表明推理片段与token消耗和模型性能密切相关,我们设计了跨片段簇的长度感知加权机制。大量实验表明,GRSP在不过度牺牲准确性的前提下实现了更优的token效率,尤其在难题上的优势更为显著。此外,GRSP稳定了RL训练,并有效扩展至不同模型规模。
引用
@article{arxiv.2510.09535,
title = {Mitigating Overthinking through Reasoning Shaping},
author = {Feifan Song and Shaohang Wei and Bofei Gao and Yejie Wang and Wen Luo and Wei Li and Linli Yao and Weimin Xiong and Liang Chen and Tianyu Liu and Houfeng Wang},
journal= {arXiv preprint arXiv:2510.09535},
year = {2025}
}