超越推理收益:缓解大规模推理模型中的通用能力遗忘
机器学习
2025-10-28 v1 人工智能
摘要
基于可验证奖励的强化学习(RLVR)在数学和多模态推理方面取得了显著进展,已成为当今语言和视觉语言模型的标准后训练范式。然而,RLVR 配方引入了显著的能力退化风险,即模型在未采用正则化策略的情况下进行长期训练后会忘记基础技能。我们经验上确认了这一担忧,观察到开源推理模型在感知和忠诚度等核心能力上存在性能下降。虽然施加 KL 散度等正则化项可帮助防止偏离基础模型,但这些项是基于当前任务计算的,因此不能保证更广泛的知识。与此同时,常用的跨异构领域经验回放方法使得决定每个目标应获得多少训练关注变得非平凡。为此,我们提出了 RECAP—a 一种用于通用知识保留的重播策略,采用动态目标重加权。我们的重加权机制通过收敛和不稳定性的短视角信号,在线方式下进行自适应,将后训练关注力从已饱和的目标转向表现不佳或波动的目标。该方法是端到端的,且可直接应用于现有的 RLVR 流水线,而无需训练额外模型或进行大量调参。针对 Qwen2.5-VL-3B 和 Qwen2.5-VL-7B 进行大量实验,证明了我们方法的有效性,该方法不仅保留了通用能力,还通过在任务内奖励之间实现更灵活的权衡,提升了推理性能。
引用
@article{arxiv.2510.21978,
title = {Beyond Reasoning Gains: Mitigating General Capabilities Forgetting in Large Reasoning Models},
author = {Hoang Phan and Xianjun Yang and Kevin Yao and Jingyu Zhang and Shengjie Bi and Xiaocheng Tang and Madian Khabsa and Lijuan Liu and Deren Lei},
journal= {arXiv preprint arXiv:2510.21978},
year = {2025}
}