利用专家示范预训练深度演员-评论家强化学习算法
人工智能
2018-02-12 v2 机器学习
机器学习
摘要
利用专家示范进行预训练因所需在线仿真数据更少,已被发现有助于加快深度强化学习算法的训练过程。一些人使用监督学习来加快特征学习过程,另一些人通过模仿专家示范来预训练策略。然而,这些方法不稳定且不适用于演员-评论家强化学习算法。此外,一些现有方法依赖于全局最优假设,而该假设在大多数情景中并不成立。本文中,我们在演员-评论家强化学习框架中采用专家示范,同时确保其性能不受专家示范非全局最优这一事实的影响。我们从理论上推导出一种仅利用专家示范计算策略梯度与价值估计量的方法。我们的方法对于预训练策略与价值函数的演员-评论家强化学习算法在理论上是合理的。我们将该方法应用于两种典型的演员-评论家强化学习算法 DDPG 与 ACER,并通过实验证明我们的方法不仅优于无预训练过程的RL算法,而且具有更高的仿真效率。
引用
@article{arxiv.1801.10459,
title = {Pretraining Deep Actor-Critic Reinforcement Learning Algorithms With Expert Demonstrations},
author = {Xiaoqin Zhang and Huimin Ma},
journal= {arXiv preprint arXiv:1801.10459},
year = {2018}
}
备注
Added acknowledgements, modified references. 7 pages, 4 figures