用 BC 增强 GAIL 以实现样本高效模仿学习
机器学习
2020-11-11 v4 机器学习
摘要
模仿学习是在无法获得奖励信号的情况下恢复专家策略的问题。行为克隆(BC)和 GAIL 是两种广泛使用的模仿学习方法。行为克隆在几次迭代内收敛,但由于其对状态-动作分布的固有独立同分布假设而不能达到峰值性能。GAIL 通过在智能体与专家之间执行状态分布匹配时考虑时间依赖性来解决该问题。尽管 GAIL 在所需专家轨迹数量上样本高效,但就策略收敛所需的环境交互而言仍不是非常样本高效。鉴于两种方法的互补优势,我们提出了一种简单而优雅的方法来结合两者,以实现稳定且样本高效的学习。我们的算法实现非常简单,并可集成到不同的策略梯度算法中。我们在低维控制任务、网格世界以及高维基于图像的任务中展示了该算法的有效性。
引用
@article{arxiv.2001.07798,
title = {Augmenting GAIL with BC for sample efficient imitation learning},
author = {Rohit Jena and Changliu Liu and Katia Sycara},
journal= {arXiv preprint arXiv:2001.07798},
year = {2020}
}