用于离线强化学习中保守价值估计的 Peng's Q($\lambda$)
机器学习
2026-05-15 v1
摘要
我们提出了一种无模型的离线多步强化学习 (RL) 算法,即保守 Peng's Q() (CPQL)。我们的算法将 Peng's Q() (PQL) 算子适配用于保守价值估计,作为 Bellman 算子的替代。据我们所知,这是离线 RL 领域中首项通过充分利用离线轨迹,在理论和经验上证明使用多步算子进行保守价值估计有效性的工作。在离线 RL 中,PQL 算子的不动点更接近行为策略的价值函数,从而自然地引发隐式行为正则化。CPQL 同时缓解了过度悲观的价值估计,实现了大于(或等于)行为策略的性能,并提供了近乎最优的性能保证——这是以往的保守方法无法实现的里程碑。在 D4RL 基准上的大量数值实验表明,CPQL 始终显著优于现有的离线单步基线方法。除了 CPQL 在离线 RL 中的贡献外,我们提出的方法还对离线到在线学习框架有所贡献。在离线设置中使用 CPQL 预训练的 Q 函数,使得在线 PQL 智能体能够避免在微调开始时通常观察到的性能下降,并获得稳健的性能提升。我们的代码可在 https://github.com/oh-lab/CPQL 获取。
引用
@article{arxiv.2605.14779,
title = {Peng's Q($\lambda$) for Conservative Value Estimation in Offline Reinforcement Learning},
author = {Byeongchan Kim and Min-hwan Oh},
journal= {arXiv preprint arXiv:2605.14779},
year = {2026}
}
备注
Accepted in ICLR 2026