中文

重新思考 RLVR 多选题:通过扰题设计解锁潜能

计算与语言 2026-03-16 v1

摘要

强化学习可验证奖励(Reinforcement Learning with Verifiable Rewards, RLVR)显著提升了大型语言模型的推理能力。对于 RLVR,多选题(Multiple-Choice Questions, MCQs)提供了可扩展的可验证数据来源,但可能诱导奖励作弊,即模型通过随机猜测或简单消除来规避推理。当前方法通常通过将 MCQs 转换为开放式格式来缓解此问题,从而丢弃专家设计扰题所提供的对比信号。在本工作中,我们系统性地研究了选项设计对 RLVR 的影响。我们的分析突显了两个主要洞见:(1)训练和测试之间选项数的不匹配会降低性能。(2)强扰题有效缓解随机猜测,使即使在 2 选题中也能进行有效的 RLVR 训练。鼓励这些发现,我们提出了迭代扰题精选(Iterative Distractor Curation, IDC)框架,通过主动构建高质量扰题以阻止消除捷径并促进深层推理。在 various benchmarks 上进行实验表明,我们的方法有效提升了扰题质量,并在与原始数据相比的 RLVR 训练中实现了显著的性能提升。

关键词

引用

@article{arxiv.2603.12826,
  title  = {Rethinking Multiple-Choice Questions for RLVR: Unlocking Potential via Distractor Design},
  author = {Xu Guo and Qiming Ge and Jian Tong and Kedi Chen and Jin Zhang and Xiaogui Yang and Xuan Gao and Haijun Lv and Zhihui Lu and Yicheng Zou and Qipeng Guo},
  journal= {arXiv preprint arXiv:2603.12826},
  year   = {2026}
}