可验证奖励的强化学习情境滚动bandit
机器学习
2026-05-26 v2 人工智能
摘要
可验证奖励的强化学习(RLVR)是提高大型语言模型推理能力的有效范式。然而,现有RLVR方法在条件不受控且短时段方式下使用滚动:同一提示下的异构质量响应被统一处理,历史滚动在单次使用后被丢弃。这导致监督噪声、样本效率差及次优策略更新。我们通过将RLVR中的滚动调度问题形式化为情境bandit问题,并提出统一的神经网络调度框架来自适应选择高价值滚动,从而解决这些问题。每个滚动被视为一只臂,其奖励定义为在连续优化步骤之间诱导的性能提升。 resulting scheduler 支持噪声感知的单元内选择以及单一原则框架内的自适应全局历史滚动复用。我们通过推导亚线性懊悼上界并表明扩大滚动缓冲区可提高可实现性能上界来提供理论依据。六个数学推理基准的实验表明,在多种RLVR优化方法下,本方法在性能和训练效率方面 consistently 实现提升。
引用
@article{arxiv.2602.08499,
title = {Contextual Rollout Bandits for Reinforcement Learning with Verifiable Rewards},
author = {Xiaodong Lu and Xiaohan Wang and Jiajun Chai and Guojun Yin and Wei Lin and Zhijun Chen and Yu Luo and Fuzhen Zhuang and Yikun Ban and Deqing Wang},
journal= {arXiv preprint arXiv:2602.08499},
year = {2026}
}