中文

Composition-RL:用于强化学习的可验证提示词组合

计算与语言 2026-04-23 v2

摘要

大规模可验证提示词是强化学习可验证奖励(RLVR)成功的基础,但其中包含许多缺乏信息的示例且扩展成本高昂。近期研究致力于通过优先处理难提示词(滚动通过率为0)来更好地利用有限训练数据。然而,随着训练进行,通过率为1的容易提示词逐渐增多,从而降低了有效数据规模。为缓解此问题,我们提出了Composition-RL,这是一种简单却有效的方法,旨在更好地利用针对通过率为1的提示词的有限可验证提示。具体而言,Composition-RL自动将多个问题组合成新型可验证问题,并使用这些组合提示进行RL训练。跨模型规模4B至30B的大量实验表明,Composition-RL在原有数据集训练的RL模型持续提升了推理能力。性能可通过一种课程变体进一步提升,该变体在训练期间逐渐增加组合深度。此外,Composition-RL实现了更有效的跨域RL,通过组合来自不同领域的提示。代码、数据集和模型均已在 https://github.com/XinXU-USTC/Composition-RL 提供。

关键词

引用

@article{arxiv.2602.12036,
  title  = {Composition-RL: Compose Your Verifiable Prompts for Reinforcement Learning of Large Language Models},
  author = {Xin Xu and Clive Bai and Kai Yang and Tianhao Chen and Yangkun Chen and Weijie Liu and Hao Chen and Yang Wang and Saiyong Yang and Can Yang},
  journal= {arXiv preprint arXiv:2602.12036},
  year   = {2026}
}