AVID:通过人体视频的像素级转换学习多阶段任务
机器人学
2020-06-23 v3 计算机视觉与模式识别
机器学习
摘要
机器人强化学习 (RL) 有望使机器人通过经验学习复杂行为。然而,在真实世界中实现长视野任务的这一前景,需要机制来减轻人类在定义任务与搭建学习过程方面的负担。本文中,我们研究如何利用自动化机器人学习框架缓解这些挑战:多阶段任务仅需提供人类演示者视频来定义,随后由机器人从原始图像观测自主学习。模仿人类视频的一个核心挑战是人类与机器人外观差异,通常需人工对应。我们转而采用自动化方法,通过 CycleGAN 进行像素级图像转换,将人类演示转为机器人视频,进而用于为基于模型的 RL 算法构建奖励函数。机器人随后逐阶段学习任务,自动学会重置各阶段以多次重试而无需人工提供重置。这使学习过程高度自动,从直观的视频任务指定到最少人工干预的自动训练。我们证明该方法能够从原始图像观测直接学习如操作咖啡机之类的复杂任务,仅需 20 分钟提供人类演示、约 180 分钟机器人交互。
引用
@article{arxiv.1912.04443,
title = {AVID: Learning Multi-Stage Tasks via Pixel-Level Translation of Human Videos},
author = {Laura Smith and Nikita Dhawan and Marvin Zhang and Pieter Abbeel and Sergey Levine},
journal= {arXiv preprint arXiv:1912.04443},
year = {2020}
}
备注
Robotics: Science and Systems (RSS) 2020 camera ready submission. Project website: https://sites.google.com/view/rss20avid