基于观测的离屏策略模仿学习
机器学习
2021-03-01 v1 人工智能
摘要
从观测中学习(LfO)是一种实用的强化学习场景,许多应用可通过重用不完整资源而受益。与常规模仿学习(IL)相比,LfO由于缺乏专家动作指导而更具挑战性。在常规IL和LfO中,分布匹配都是其基础的核心。传统的分布匹配方法样本代价高,依赖用于策略学习的on-policy转移。为提升样本效率,已有一些off-policy解决方案被提出,但它们要么缺乏全面的理论依据,要么依赖专家动作的指导。本工作中,我们提出一种样本高效的LfO方法,能够以原则性方式实现off-policy优化。为进一步加速学习过程,我们使用逆动作模型来调节策略更新,该模型从mode-covering的角度辅助分布匹配。在具有挑战性的运动任务上的大量实证结果表明,我们的方法在样本效率和渐近性能方面均与最先进水平相当。
引用
@article{arxiv.2102.13185,
title = {Off-Policy Imitation Learning from Observations},
author = {Zhuangdi Zhu and Kaixiang Lin and Bo Dai and Jiayu Zhou},
journal= {arXiv preprint arXiv:2102.13185},
year = {2021}
}