离策略学习推理有效:因为它比你想象的更悲观
机器学习
2026-05-28 v1
摘要
大规模强化学习已成为改进大型语言模型推理能力的核心工具。在此规模下,生成往往滞后或异步进行,因此更新是在较旧策略收集的数据上执行的。这使得学习本质上是离策略的。大多数现有方法仍根植于 PPO 风格的信任区间目标,将训练视为近似在策略上,并使用重要性权重来纠正分布不匹配。这些纠正可能引入高方差, destabilize 优化,并加速熵崩溃。最近的工作提出另一种方法:而不是纠正不匹配,可以拥抱离策略数据并移除重要性权重,往往会产生更强的算法。在本文中,我们提供了一种对离策略目标的直观构建,包含成功的离策目标,并展示其有效性可以通过隐式悲观性来理解:它们优化的目标策略比其名义目标所暗示的更保守。我们表明,这一视角解释了为何某些特定实现选择会提高稳定性:它们隐式地控制了有效目标分布。我们随后提出了一种原则性的修改,用于稳定此诱导分布并提高离策略学习的效果。
引用
@article{arxiv.2605.28150,
title = {Off-Policy Learning to Reason Works Because It Is More Pessimistic Than You Think},
author = {Otmane Sakhi and Aleksei Arzhantsev and Imad Aouali and Flavian Vasile},
journal= {arXiv preprint arXiv:2605.28150},
year = {2026}
}