基于思考的非思考:通过强化学习解决混合推理模型训练中的奖励作弊问题
人工智能
2026-01-09 v1
摘要
大型推理模型因其卓越的性能而备受关注。然而,其性能主要源于思考,即长思维链,这显著增加了计算开销。为解决这一过度思考问题,现有工作侧重于使用强化学习训练混合推理模型,使其能够根据查询的复杂度自动决定是否进行思考。遗憾的是,使用强化学习会遭遇奖励作弊问题,例如模型进行了思考却被判定为未思考,从而导致错误的奖励。为缓解此问题,现有工作要么采用监督微调,其计算成本高昂;要么对非思考响应强制施加统一的 token 限制,对问题的缓解效果有限。在本文中,我们提出了基于思考的非思考。该方法不采用监督微调,而是通过利用思考响应中解答部分的信息,针对不同查询中不使用思考的响应设定不同的最大 token 使用量。在五个数学基准上的实验表明,与 DeepSeek-R1-Distill-Qwen-1.5B/7B 和 DeepScaleR-1.5B 相比,TNT 将 token 使用量减少了约 50%,同时显著提高了准确率。事实上,在所有测试方法中,TNT 在准确率与效率之间实现了最佳权衡。此外,在所有测试数据集上,TNT 中被判定为未思考的响应发生奖励作弊问题的概率始终低于 10%。
引用
@article{arxiv.2601.04805,
title = {Thinking-Based Non-Thinking: Solving the Reward Hacking Problem in Training Hybrid Reasoning Models via Reinforcement Learning},
author = {Siyuan Gan and Jiaheng Liu and Boyan Wang and Tianpei Yang and Runqing Miao and Yuyao Zhang and Fanyu Meng and Junlan Feng and Linjian Meng and Jing Huo and Yang Gao},
journal= {arXiv preprint arXiv:2601.04805},
year = {2026}
}