Habitat-Web: Learning Embodied Object-Search Strategies from Human Demonstrations at Scale
摘要
我们展示了一项大规模研究,该研究在要求虚拟机器人在新环境中搜索物体的任务上模仿人类演示——(1)ObjectGoal导航(例如,“找到并走到一把椅子”)和(2)Pick&Place(例如,“找到杯子,拿起杯子,找到台面,把杯子放在台面上”)。首先,我们开发了一个虚拟遥操作数据收集基础设施——将运行在网页浏览器中的Habitat模拟器连接到Amazon Mechanical Turk,允许远程用户安全地、大规模地遥操作虚拟机器人。我们为ObjectNav收集了8万个演示,为Pick&Place收集了1.2万个演示,这比模拟或真实机器人上现有的人类演示数据集大一个数量级。其次,我们试图回答这个问题——大规模模仿学习(IL)(迄今为止尚不可能)与强化学习(RL)(这是现状)相比如何?在ObjectGoal导航上,我们发现使用7万个人类演示的IL(没有任何附加技巧)优于使用24万个智能体收集轨迹的RL。经过IL训练的智能体展示了高效的物体搜索行为——它窥视房间,检查角落寻找小物体,原地转动以获得全景视图——这些行为在RL智能体上都没有如此突出地表现出来,而要通过RL诱导这些行为将需要繁琐的奖励工程。最后,准确率与训练数据大小的关系图显示了有希望的扩展行为,表明简单地收集更多演示很可能进一步推动最先进水平。在Pick&Place上,对比更加鲜明——当用9.5千个人类演示训练时,IL智能体在具有新物体-容器位置的回合上达到了约18%的成功率,而RL智能体未能超过0%。总的来说,我们的工作为投资大规模模仿学习提供了令人信服的证据。项目页面:https://ram81.github.io/projects/habitat-web。
引用
@article{arxiv.2204.03514,
title = {Habitat-Web: Learning Embodied Object-Search Strategies from Human Demonstrations at Scale},
author = {Ram Ramrakhya and Eric Undersander and Dhruv Batra and Abhishek Das},
journal= {arXiv preprint arXiv:2204.03514},
year = {2022}
}
备注
8 pages + supplement; fixed typos