任务相关对抗模仿学习
机器学习
2020-11-13 v2 人工智能
机器人学
机器学习
摘要
我们指出对抗模仿中的一个关键漏洞是判别器网络倾向于在视觉特征与专家标签之间学习虚假关联。当判别器关注任务无关特征时,它无法提供信息丰富的奖励信号,导致糟糕的任务表现。我们详细分析了该问题并提出了一种优于标准生成对抗模仿学习(Generative Adversarial Imitation Learning, GAIL)的解决方案。我们提出的方法,任务相关对抗模仿学习(Task-Relevant Adversarial Imitation Learning, TRAIL),使用约束判别器优化来学习信息丰富的奖励。在综合实验中,我们展示 TRAIL 可以通过模仿人类操作者从像素解决具挑战性的机器人操纵任务,且无需任何任务奖励,并明显优于可比的基线模仿智能体,包括那些通过行为克隆(behaviour cloning)和常规 GAIL 训练的智能体。
引用
@article{arxiv.1910.01077,
title = {Task-Relevant Adversarial Imitation Learning},
author = {Konrad Zolna and Scott Reed and Alexander Novikov and Sergio Gomez Colmenarejo and David Budden and Serkan Cabi and Misha Denil and Nando de Freitas and Ziyu Wang},
journal= {arXiv preprint arXiv:1910.01077},
year = {2020}
}
备注
Accepted to CoRL 2020 (see presentation here: https://youtu.be/ZgQvFGuEgFU )