简单的“动机”可增强大型推理模型的强化微调
计算与语言
2026-03-10 v3 人工智能
摘要
具有可验证奖励的强化学习 (RLVR) 已成为大型推理模型处理复杂任务的一种强大的学习推理范式。然而,当前的RLVR范式仍然不够高效,因为它以试错方式工作。为了表现更好,模型需要通过生成大量响应来探索奖励空间,并从碎片化的奖励信号中学习,而对整体的奖励模式视而不见。幸运的是,可验证奖励使得奖励函数的自然语言描述成为可能,同时,LLMs 已经展示了强大的上下文学习能力。这促使我们探索大型推理模型是否可以在强化微调过程中受益于任务的**动机**,即对奖励函数的感知,就像我们人类在学习时有时所做的那样。在本文中,我们介绍了**动机增强的强化微调** (MeRF),这是一种直观而有效的方法,通过涉及“告诉LLMs游戏规则”来增强LLMs的强化微调。具体来说,**MeRF** 直接将奖励规范注入提示中,作为模型感知优化目标的上下文动机。这种简单的修改利用了LLMs的上下文学习能力,使生成与优化对齐,从而激励模型从内在动机和外部奖励两方面生成期望的输出。实证评估表明,**MeRF** 相对于RLVR基线取得了显著的性能提升。此外,消融研究表明,当上下文动机与外部奖励函数之间具有更大的一致性时,MeRF表现更好,同时模型也展示了通过强化微调适应误导性动机的能力。
引用
@article{arxiv.2506.18485,
title = {A Simple "Motivation" Can Enhance Reinforcement Finetuning of Large Reasoning Models},
author = {Junjie Zhang and Guozheng Ma and Shunyu Liu and Haoyu Wang and Jiaxing Huang and Ting-En Lin and Fei Huang and Yongbin Li and Dacheng Tao},
journal= {arXiv preprint arXiv:2506.18485},
year = {2026}
}