多样行为的鲁棒模仿
机器学习
2017-07-17 v2
摘要
深度生成模型最近在运动控制的模仿学习中展现出巨大前景。给定足够数据,即使是监督方法也能进行一次性模仿学习;然而,当智能体轨迹偏离演示时,它们容易出现级联失败。与纯监督方法相比,生成对抗模仿学习(GAIL)能从更少演示中学习更鲁棒的控制器,但本质上是模式寻求的且更难训练。本文中,我们展示如何结合这两种方法的有利方面。我们模型的基底是一种用于演示轨迹的新型变分自编码器,其学习语义策略嵌入。我们展示了这些嵌入可以在9自由度Jaco机械臂的到达任务中学习,然后平滑插值,从而实现到达行为的平滑插值。利用这些策略表示,我们开发了GAIL的新版本,其(1)比纯监督控制器鲁棒得多,尤其在演示较少时;(2)避免模式崩溃,在GAIL单独使用时未能捕获的许多多样行为时被捕获。我们在MuJoCo物理环境中在2D双足和62自由度3D人形上从演示学习多样步态展示了我们的方法。
引用
@article{arxiv.1707.02747,
title = {Robust Imitation of Diverse Behaviors},
author = {Ziyu Wang and Josh Merel and Scott Reed and Greg Wayne and Nando de Freitas and Nicolas Heess},
journal= {arXiv preprint arXiv:1707.02747},
year = {2017}
}