基于模型的离线强化学习 with Count-based Conservatism
机器学习
2023-07-24 v1 机器学习
摘要
本文提出一种集成基于计数的保守性的基于模型的离线强化学习方法,命名为 。我们的方法利用状态-动作对的计数估计来量化模型估计误差,据我们所知,这是首个在基于模型的离线深度 RL 中证明基于计数的保守性有效性的算法。对于我们提出的方法,我们首先表明估计误差与状态-动作对的频率成反比。其次,我们证明在基于计数的保守模型下学习的策略提供近最优性能保证。通过大量数值实验,我们验证了采用哈希码实现的 在 D4RL 基准数据集上显著优于现有离线 RL 算法。代码可在 获取。
引用
@article{arxiv.2307.11352,
title = {Model-based Offline Reinforcement Learning with Count-based Conservatism},
author = {Byeongchan Kim and Min-hwan Oh},
journal= {arXiv preprint arXiv:2307.11352},
year = {2023}
}
备注
Accepted in ICML 2023