单射状态-图像映射促进视觉对抗模仿学习
机器学习
2019-10-28 v2 计算机视觉与模式识别
机器学习
摘要
在游戏和娱乐等应用中,虚拟自主智能体的使用日益增长,这要求更好的控制策略以实现自然外观的运动和动作。与硬编码运动例程的传统方法不同,我们提出了一种深度学习方法,通过直接模仿原始视频演示来获取控制策略。该领域先前的方法依赖于从专家视频中提取低维特征,随后进行单独的手工设计奖励估计步骤。我们提出了一种模仿学习框架,通过使用生成对抗网络(GANs)联合学习特征提取和奖励估计步骤,减少对手工设计奖励函数的依赖。本文的主要贡献是证明在低级关节状态(角度和速度)轨迹与相应原始视频流之间的单射映射下,对视频演示进行对抗模仿学习等价于从状态轨迹中学习。实验结果表明,所提出的基于原始视频的对抗学习方法取得了与最先进模仿学习技术相似的性能,同时经常优于现有的手工设计视频模仿方法。此外,我们表明我们的方法可以通过模仿 YouTube 上的视频演示来学习动作策略,其性能与从真实奖励信号学习的智能体相似。请见补充视频提交 https://ibm.biz/BdzzNA。
引用
@article{arxiv.1810.01108,
title = {Injective State-Image Mapping facilitates Visual Adversarial Imitation Learning},
author = {Subhajit Chaudhury and Daiki Kimura and Asim Munawar and Ryuki Tachibana},
journal= {arXiv preprint arXiv:1810.01108},
year = {2019}
}
备注
Updated the paper to match with version accepted at IEEE MMSP 2019