中文

AutoRT:用于大规模机器人智能体编排的具身基础模型

机器人学 2024-07-03 v2 人工智能 计算与语言 计算机视觉与模式识别 机器学习

摘要

融合了语言、视觉以及最近的动作的基础模型,已经彻底改变了利用互联网规模数据来推理有用任务的能力。然而,训练具身基础模型的关键挑战之一是缺乏基于物理世界的数据。在本文中,我们提出了AutoRT,一个利用现有基础模型在完全未知的场景中扩大操作机器人部署规模、且仅需最少人工监督的系统。AutoRT利用视觉-语言模型(VLM)进行场景理解和基础定位,并进一步使用大语言模型(LLM)为机器人集群提出多样且新颖的指令。通过利用基础模型的知识来指导数据收集,使AutoRT能够有效地推理自主性权衡与安全性,同时显著扩大机器人学习的数据收集规模。我们展示了AutoRT在多个建筑中向超过20台机器人提出指令,并通过遥操作和自主机器人策略收集了77000个真实机器人片段。我们通过实验表明,由AutoRT收集的这种“野外”数据显著更加多样化,并且AutoRT对LLM的使用使得指令遵循的数据收集机器人能够与人类偏好对齐。

关键词

引用

@article{arxiv.2401.12963,
  title  = {AutoRT: Embodied Foundation Models for Large Scale Orchestration of Robotic Agents},
  author = {Michael Ahn and Debidatta Dwibedi and Chelsea Finn and Montse Gonzalez Arenas and Keerthana Gopalakrishnan and Karol Hausman and Brian Ichter and Alex Irpan and Nikhil Joshi and Ryan Julian and Sean Kirmani and Isabel Leal and Edward Lee and Sergey Levine and Yao Lu and Isabel Leal and Sharath Maddineni and Kanishka Rao and Dorsa Sadigh and Pannag Sanketi and Pierre Sermanet and Quan Vuong and Stefan Welker and Fei Xia and Ted Xiao and Peng Xu and Steve Xu and Zhuo Xu},
  journal= {arXiv preprint arXiv:2401.12963},
  year   = {2024}
}

备注

26 pages, 9 figures, ICRA 2024 VLMNM Workshop