中文

领域自适应模仿学习

机器学习 2020-07-21 v2 人工智能 机器学习

摘要

我们研究如何跨具有 embodiment、视角和动力学差异等领域差异来模仿任务。许多先前的工作需要配对的、对齐的演示以及一个需要环境交互的额外强化学习步骤。然而,配对的、对齐的演示很少可获得,且强化学习过程代价高昂。我们形式化了领域自适应模仿学习(Domain Adaptive Imitation Learning, DAIL)问题,这是一个在存在视角、embodiment 和动力学不匹配情况下的统一模仿学习框架。非正式地说,DAIL 是在给定某一不同领域中该任务的演示的情况下,学习如何最优地执行该任务的过程。我们提出一种两步法来解决 DAIL:先对齐,后适配。在对齐步骤中,我们执行一种新颖的无监督 MDP 对齐算法,即生成对抗式 MDP 对齐(Generative Adversarial MDP Alignment, GAMA),从未配对的、未对齐的演示中学习状态和动作对应关系。在适配步骤中,我们利用这些对应关系跨领域零样本模仿任务。为了描述何时可通过对齐与适配实现 DAIL,我们引入了 MDP 可对齐性理论。我们在 embodiment、视角和动力学不匹配场景中对 GAMA 与基线进行实验评估,其中不存在对齐的演示,并展示了我们方法的有效性。

关键词

引用

@article{arxiv.1910.00105,
  title  = {Domain Adaptive Imitation Learning},
  author = {Kuno Kim and Yihong Gu and Jiaming Song and Shengjia Zhao and Stefano Ermon},
  journal= {arXiv preprint arXiv:1910.00105},
  year   = {2020}
}

备注

ICML 2020