中文

MEML-GRPO:用于RLVR提升的异构多专家互动学习

人工智能 2025-12-19 v2

摘要

近期的进展表明,强化学习可验证奖励(RLVR)显著增强了大型语言模型(LLM)的推理能力。然而,标准RLVR面临奖励稀疏的问题,即在具有挑战性的任务中,来自持续错误候选答案的零奖励提供了没有学习信号。为此,我们提出了多专家互动学习GRPO(MEML-GRPO),一种创新的框架,该框架利用多样化的专家提示作为系统提示,以生成更广泛的响应,从而大幅提高找到正确解答的可能性。此外,我们引入了专家间的互动学习机制,以促进知识在专家之间的共享和转移,进一步通过RLVR提升模型性能。在多个推理基准测试中进行了大量实验,结果表明MEML-GRPO显著改进了性能,Qwen实现平均性能提升4.89%,Llama实现11.33%的提升,有效克服了传统RLVR方法的核心局限性。

关键词

引用

@article{arxiv.2508.09670,
  title  = {MEML-GRPO: Heterogeneous Multi-Expert Mutual Learning for RLVR Advancement},
  author = {Weitao Jia and Jinghui Lu and Haiyang Yu and Siqi Wang and Guozhi Tang and An-Lan Wang and Weijie Yin and Dingkang Yang and Yuxiang Nie and Bin Shan and Hao Feng and Irene Li and Kun Yang and Han Wang and Jingqun Tang and Teng Fu and Changhong Jin and Chao Feng and Xiaohui Lv and Can Huang},
  journal= {arXiv preprint arXiv:2508.09670},
  year   = {2025}
}