BAIL:面向批量深度强化学习的最优动作模仿学习
机器学习
2020-11-03 v4 人工智能
机器学习
摘要
近期批量深度强化学习(DRL)研究激增,其旨在从给定数据集学习高性能策略而无需与环境额外交互。我们提出一种新算法——最优动作模仿学习(BAIL),力求简洁与性能兼得。BAIL 学习一个 V 函数,利用该 V 函数选择其认为高性能的动作,随后使用这些动作通过模仿学习训练策略网络。针对 MuJoCo 基准,我们对 BAIL 进行了全面的实验研究,将其性能与四种其他批量 Q 学习与模仿学习方案在大量不同批量数据集上进行比较。实验表明,BAIL 的性能远高于其他方案,且在计算上也远快于批量 Q 学习方案。
引用
@article{arxiv.1910.12179,
title = {BAIL: Best-Action Imitation Learning for Batch Deep Reinforcement Learning},
author = {Xinyue Chen and Zijian Zhou and Zheng Wang and Che Wang and Yanqiu Wu and Keith Ross},
journal= {arXiv preprint arXiv:1910.12179},
year = {2020}
}
备注
27 pages(15 pages for appendix); Published in 34th Conference on Neural Information Processing Systems (NeurIPS 2020)