正则化行为价值估计
机器学习
2021-03-18 v1
摘要
离线强化学习将学习过程限制为仅依赖记录数据而无法访问环境。虽然这实现了实际应用,但也带来了独特的挑战。一个重要挑战是处理因训练数据未充分覆盖的状态-动作对的价值被高估所引起的误差。由于自举,这些误差在训练过程中被放大并可能导致发散,从而削弱学习。为克服这一挑战,我们提出了正则化行为价值估计(R-BVE)。与大多数在训练期间使用策略改进的方法不同,R-BVE在训练期间估计行为策略的价值,并仅在部署时执行策略改进。此外,R-BVE使用一种排序正则化项,偏好数据集中导致成功结果的行为。我们提供了大量经验证据证明了R-BVE的有效性,包括在RL Unplugged ATARI数据集上取得最先进的性能。我们还在来自bsuite和一个具有挑战性的DeepMind Lab任务的新数据集上测试了R-BVE,并表明R-BVE优于其他最先进的离散控制离线RL方法。
引用
@article{arxiv.2103.09575,
title = {Regularized Behavior Value Estimation},
author = {Caglar Gulcehre and Sergio Gómez Colmenarejo and Ziyu Wang and Jakub Sygnowski and Thomas Paine and Konrad Zolna and Yutian Chen and Matthew Hoffman and Razvan Pascanu and Nando de Freitas},
journal= {arXiv preprint arXiv:2103.09575},
year = {2021}
}