中文

从“野外”人类视频中学习可泛化的机器人奖励函数

机器人学 2021-04-01 v1 人工智能 计算机视觉与模式识别 机器学习

摘要

我们的动机源于通用机器人这一目标:其能在多种环境中完成广泛任务。关键在于机器人获取任务成功或奖励某种度量的能力,这对于强化学习、规划或知晓何时求助是必要的。对于在真实世界中运行的通用机器人,该奖励函数还必须能跨环境、任务和物体广泛泛化,同时仅依赖机载传感器观测(如RGB图像)。尽管大规模多样数据上的深度学习已在计算机视觉与自然语言领域展现出此类泛化的前景,但大规模收集高质量机器人交互数据仍是一项开放挑战。相比之下,“野外”人类视频(如YouTube)包含了大量人在多样环境中执行有趣任务的素材。本工作中,我们提出一种简单方法——域无关视频判别器(DVD),通过训练判别器分类两段视频是否执行同一任务来学习多任务奖励函数,并借助少量机器人数据与广泛人类视频数据集的学习实现泛化。我们发现,利用多样人类数据集,该奖励函数(a)可零样本泛化至未见环境,(b)可零样本泛化至未见任务,(c)可与视觉模型预测控制结合,从单条人类演示出发在未见环境中用真实WidowX200机器人解决操纵任务。

关键词

引用

@article{arxiv.2103.16817,
  title  = {Learning Generalizable Robotic Reward Functions from "In-The-Wild" Human Videos},
  author = {Annie S. Chen and Suraj Nair and Chelsea Finn},
  journal= {arXiv preprint arXiv:2103.16817},
  year   = {2021}
}

备注

https://sites.google.com/view/dvd-human-videos