仅从观测出发的可证明高效模仿学习
机器学习
2019-06-12 v2 机器学习
摘要
我们在大规模 MDP 中研究仅从观测出发的模仿学习(ILFO)。虽然大多数 IL 算法依赖于专家直接向学习器提供动作,但在该设定下专家仅提供观测序列。我们为 ILFO 设计了一种新的无模型算法——前向对抗模仿学习(FAIL),它通过最小化专家策略与学习器观测分布之间的积分概率度量来学习一系列时间依赖策略。FAIL 是 ILFO 设定中首个可证明高效的算法,它以在所有相关参数上均为多项式、且独立于唯一观测数量的样本数学习到近最优策略。所得理论将可证明样本高效学习算法的领域扩展到现有结果之外,现有结果通常仅考虑表格强化学习设定或需要访问近最优重置分布的设定。我们还研究了 FAIL 在基于模型设定中的扩展。最后我们在多个 OpenAI Gym 控制任务上展示了 FAIL 的有效性。
引用
@article{arxiv.1905.10948,
title = {Provably Efficient Imitation Learning from Observation Alone},
author = {Wen Sun and Anirudh Vemula and Byron Boots and J. Andrew Bagnell},
journal= {arXiv preprint arXiv:1905.10948},
year = {2019}
}
备注
ICML 2019