中文

用于离线策略优化的保守贝叶斯基于模型的值扩展

机器学习 2023-03-06 v2

摘要

离线强化学习(RL)解决了从由某种行为策略收集的固定批次数据中学习高性能策略的问题。基于模型的方法在离线设定中尤为吸引人,因为它们可以通过学习环境模型从记录数据集中提取更多学习信号。然而,由于所学模型中估计误差的累积,现有基于模型的方法性能不及无模型方法。受此观察驱动,我们认为基于模型的方法关键在于理解何时信任模型、何时依赖无模型估计,以及如何对两者都保持保守。为此,我们推导出一种优雅而简单的方法,称为用于离线策略优化的保守贝叶斯基于模型的值扩展(CBOP),其在策略评估步骤中根据认知不确定性权衡无模型与基于模型的估计,并通过取贝叶斯后验值估计的下界来促进保守性。在标准 D4RL 连续控制任务上,我们发现我们的方法显著优于先前的基于模型方法:例如,相对 MOPO 提升 116.4116.4%,相对 MOReL 提升 23.223.2%,相对 COMBO 提升 23.723.7%。此外,CBOP 在 1818 个基准数据集中的 1111 个上达到了最先进性能,在其余数据集上表现相当。

关键词

引用

@article{arxiv.2210.03802,
  title  = {Conservative Bayesian Model-Based Value Expansion for Offline Policy Optimization},
  author = {Jihwan Jeong and Xiaoyu Wang and Michael Gimelfarb and Hyunwoo Kim and Baher Abdulhai and Scott Sanner},
  journal= {arXiv preprint arXiv:2210.03802},
  year   = {2023}
}