混合还是合并:面向大语言模型的多领域强化学习
人工智能
2026-03-12 v3
摘要
基于可验证奖励的强化学习(RLVR)在激发大语言模型(LLM)显式推理能力方面发挥着关键作用。我们可以通过RLVR在某些特定领域(如编程或数学)实现专家水平的性能。当需要构建通用的多领域专家级模型时,就需要仔细考虑不同领域RLVR的协同工作。当前的前沿模型主要采用两种不同的训练范式进行多领域RLVR:混合多任务RLVR和独立RLVR后模型合并。然而,大多数研究未对这两种范式进行详细的比较与分析。为此,我们选取数学、编程、科学、指令遵循和智能体等多个常用高层次任务作为目标领域,并使用开源数据集设计了大量的定性和定量实验。我们发现领域间的RLVR几乎不存在相互干扰,推理密集型领域表现出相互的协同增益。此外,我们从权重空间几何、信息约束、模型预测行为和自我验证等角度分析了相互收益的内部机制。该项目命名为M2RL,意为Mixed multi-task training or separate training followed by model Merging for Reinforcement Learning,其主页地址为https://github.com/Mosi-AI/M2RL。
引用
@article{arxiv.2602.12566,
title = {To Mix or To Merge: Toward Multi-Domain Reinforcement Learning for Large Language Models},
author = {Haoqing Wang and Xiang Long and Ziheng Li and Yilong Xu and Tingguang Li and Yehui Tang},
journal= {arXiv preprint arXiv:2602.12566},
year = {2026}
}