中文

从被动人类视频进行零样本机器人操作

机器人学 2023-02-07 v1 机器学习

摘要

我们能否仅通过观看人类在不同非结构化环境中执行任意任务的视频来学习日常任务的机器人操作?与广泛采用的策略(学习特定任务行为或直接模仿人类视频)不同,我们开发了一个框架,用于从人类视频中提取与智能体无关的动作表示,然后在部署时将其映射到智能体的具身形态。我们的框架基于给定场景初始图像预测合理的人类手部轨迹。在互联网上多样的人类视频上训练该预测模型后,我们将其零样本部署到物理机器人操作任务中,经过适当的变换以适应机器人的具身形态。这种简单的策略使我们能够解决粗粒度的操作任务,如打开和关闭抽屉、推拉和工具使用,而无需任何领域内的机器人操作轨迹。我们的实际部署结果为动作预测信息建立了一个强基线,这些信息可以从多样的人类活动任意视频中获取,并可用于未见场景中的零样本机器人操作。

关键词

引用

@article{arxiv.2302.02011,
  title  = {Zero-Shot Robot Manipulation from Passive Human Videos},
  author = {Homanga Bharadhwaj and Abhinav Gupta and Shubham Tulsiani and Vikash Kumar},
  journal= {arXiv preprint arXiv:2302.02011},
  year   = {2023}
}

备注

Preprint. Under review