中文

缓冲区 matters:释放大语言模型推理中基于离策略强化学习的力量

人工智能 2026-03-17 v2

摘要

传统的基于可验证奖励的 on-policy 强化学习(RL)框架存在经验浪费和奖励同质化的问题,这直接限制了在大语言模型后训练中处理困难样本的学习效率。在本文中,我们引入 Batch Adaptation Policy Optimization(BAPO),一种用于改进大语言模型后训练数据效率的离策略 RLVR 框架。它通过动态选择训练 batch,重新评估历史上困难的样本并重用高质量的样本,同时保持策略改进的下界保证。广泛的实验进一步表明,BAPO 在数学、规划和视觉推理任务上平均超过 GRPO 提高 12.5%。关键的是,BAPO 成功解决了 40.7% 的问题,这些问题是基础模型持续无法解决的。

关键词

引用

@article{arxiv.2602.20722,
  title  = {Buffer Matters: Unleashing the Power of Off-Policy Reinforcement Learning in Large Language Model Reasoning},
  author = {Xu Wan and Yansheng Wang and Wenqi Huang and Mingyang Sun},
  journal= {arXiv preprint arXiv:2602.20722},
  year   = {2026}
}