中文

贝叶斯保守策略优化(BCPO):一种基于可信下界的不确定性校准离线强化学习

统计方法学 2026-03-16 v1 机器学习

摘要

离线强化学习旨在从固定的日志转移批次中学习决策策略,而无需额外的环境交互。尽管取得了显著的经验性进展,但离线强化学习在分布迁移下仍然脆弱:基于价值的方法可能高估未见动作的价值,导致这些策略利用模型错误而非真正的长期奖励。我们提出了\emph{贝叶斯保守策略优化(BCPO)},一个统一的框架,将认识论不确定性转化为\emph{可证明保守}的策略改进。BCPO维护对环境/价值模型的层次贝叶斯后验,构建动作价值的\emph{可信下界}(LCB),并在明确的KL正则化下针对行为分布执行策略更新。这导致离线场景中保守策略迭代的不确定性校准类比。我们提供了有限MDP理论,表明悲观固定点低于真实价值函数,且KL控制的更新改进可计算的收益下界。经验上,我们在通过\texttt{d3rlpy}生态系统获得的CartPole基准测试的真实离线回放数据集上验证了该方法,并报告了诊断,将不确定性增长与策略漂移关联到离线不稳定性,以此激励原则性的早期停止和校准。

关键词

引用

@article{arxiv.2603.12284,
  title  = {Bayesian Conservative Policy Optimization (BCPO): A Novel Uncertainty-Calibrated Offline Reinforcement Learning with Credible Lower Bounds},
  author = {Debashis Chatterjee},
  journal= {arXiv preprint arXiv:2603.12284},
  year   = {2026}
}