中文

机器人效用模型:在新环境中零样本部署的通用策略

机器人学 2024-09-10 v1 机器学习

摘要

近期,尤其是基于大量数据训练的机器人模型已显示出丰富的现实世界操纵和导航能力。已有多个独立工作表明,在特定环境中获得足够的训练数据后,机器人策略能够推广到该环境中所示示变异。然而,针对每个新环境都需要对机器人模型进行微调,与语言或视觉模型在开放世界问题上实现零样本部署的做法截然不同。本文提出了机器人效用模型 (RUMs),一个用于训练和部署能够直接推广至新环境且无需微调的零样本机器人策略的框架。为高效创建 RUMs,我们开发了新的工具来快速收集移动操纵任务的数据,将此类数据整合到基于多模态模仿学习的策略中,并在 Hello Robot Stretch 这台廉价通用机器人上部署策略,同时使用外部小型大语言模型 (mLLM) 验证器进行重试。我们训练了五个效用模型,用于打开橱柜门、打开抽屉、捡起餐巾、捡起纸袋以及重新定位倒下的物体。在平均情况下,这些系统在未见的、新颖的环境中与未见过的物体交互时 achieves 90% 的成功率。此外,效用模型还能在不同的机器人和摄像机配置下无需额外数据、训练或微调的情况下成功工作。我们的主要经验教训包括:训练数据比训练算法和策略类别更为重要、关于数据规模的指导意见、对多样且高质量演示的必要性,以及机器人自省和重试以提高单个环境性能的配方。我们的代码、数据、模型、硬件设计以及实验和部署视频均已开源,可在项目网站 https://robotutilitymodels.com 查找。

关键词

引用

@article{arxiv.2409.05865,
  title  = {Robot Utility Models: General Policies for Zero-Shot Deployment in New Environments},
  author = {Haritheja Etukuru and Norihito Naka and Zijin Hu and Seungjae Lee and Julian Mehu and Aaron Edsinger and Chris Paxton and Soumith Chintala and Lerrel Pinto and Nur Muhammad Mahi Shafiullah},
  journal= {arXiv preprint arXiv:2409.05865},
  year   = {2024}
}

备注

Project website https://robotutilitymodels.com