中文

Jackpot:基于最优预算拒绝抽样的极端演员-策略不匹配强化学习

人工智能 2026-02-09 v1

摘要

大型语言模型(LLM)的强化学习(RL)仍然昂贵,尤其是因为 rollout 过程成本高昂。将 rollout 生成与策略优化解耦(例如利用更高效的模型进行 rollout)可能实现显著的效率提升,但这会引入严重的分布不匹配,导致学习不稳定。我们提出的 Jackpot 框架利用最优预算拒绝抽样(Optimal Budget Rejection Sampling, OBRS)直接减少 rollout 模型与演化策略之间的差异。Jackpot 集成了原则化的 OBRS 流程、统一的训练目标(联合更新策略和 rollout 模型),以及由 top-kk 概率估计和批量级偏差校正所支持的高效系统实现。我们的理论分析表明,OBRS 在可控接受预算下持续地将 rollout 分布靠近目标分布。经验上,\sys 相对于重要性抽样基线显著提高了训练稳定性,在 batchsize 为 64、最多进行 300 次 update 步骤的情况下,达到了与 on-policy RL 相当的性能。总体而言,我们的结果表明,基于 OBRS 的对齐技术为 LLM 的 RL 实现 rollout 生成与策略优化之间的实际且有效的解耦迈出了重要一步。

关键词

引用

@article{arxiv.2602.06107,
  title  = {Jackpot: Optimal Budgeted Rejection Sampling for Extreme Actor-Policy Mismatch Reinforcement Learning},
  author = {Zhuoming Chen and Hongyi Liu and Yang Zhou and Haizhong Zheng and Beidi Chen},
  journal= {arXiv preprint arXiv:2602.06107},
  year   = {2026}
}

备注

ICLR 2026