从不完整演示中进行对抗模仿学习
机器学习
2019-06-25 v3 人工智能
机器学习
摘要
模仿学习旨在从专家演示中推导出从状态到动作的映射,即策略。现有的模仿学习方法通常要求演示中的任何动作均完全可用,而这在实际应用中难以保证。尽管已提出针对不可观测动作学习的算法,但它们仅关注状态信息,忽视了动作序列仍可能部分可用并为策略推导提供有用信息这一事实。在本文中,我们提出一种称为动作引导对抗模仿学习(AGAIL)的新算法,该算法从具有不完整动作序列(即不完整演示)的演示中学习策略。AGAIL的核心思想是将演示分离为状态轨迹与动作轨迹,并利用状态轨迹训练策略,同时在适用时以动作为辅助信息引导训练。基于生成对抗模仿学习,AGAIL包含三个组件:生成器、判别器与引导器。生成器利用判别器提供的奖励学习策略,判别器试图区分演示与策略生成样本之间的状态分布。当特定状态的演示动作可用时,引导器向生成器提供额外奖励。我们在基准任务上将AGAIL与其他方法比较,表明即使演示中的动作序列仅部分可用,AGAIL也能持续提供与最先进(SOTA)方法相当的性能。
引用
@article{arxiv.1905.12310,
title = {Adversarial Imitation Learning from Incomplete Demonstrations},
author = {Mingfei Sun and Xiaojuan Ma},
journal= {arXiv preprint arXiv:1905.12310},
year = {2019}
}
备注
Accepted to International Joint Conference on Artificial Intelligence (IJCAI-19)