中文

RoboBrain:从抽象到具体的机器人操作统一脑模型

机器人学 2025-03-26 v2 计算机视觉与模式识别

摘要

多模态大语言模型(MLLMs)的最新进展在各种多模态场景中展现出了卓越的能力。然而,它们在机器人场景中的应用,特别是对于长时程操作任务,暴露出显著的局限性。这些局限性源于当前 MLLMs 缺乏三种基本的机器人脑能力:规划能力,即将复杂的操作指令分解为可管理的子任务;可供性感知,即识别和解释交互对象可供性的能力;以及轨迹预测,即预测成功执行所需的完整操作轨迹的远见。为了从抽象到具体地增强机器人脑的核心能力,我们引入了 ShareRobot,这是一个高质量的异构数据集,标注了任务规划、对象可供性和末端执行器轨迹等多维度信息。ShareRobot 的多样性和准确性已由三位人类标注者精心完善。基于该数据集,我们开发了 RoboBrain,这是一个基于 MLLM 的模型,它结合了机器人和通用多模态数据,利用多阶段训练策略,并结合长视频和高分辨率图像来提升其机器人操作能力。大量实验表明,RoboBrain 在各种机器人任务中取得了最先进的性能,突显了其提升机器人脑能力的潜力。

关键词

引用

@article{arxiv.2502.21257,
  title  = {RoboBrain: A Unified Brain Model for Robotic Manipulation from Abstract to Concrete},
  author = {Yuheng Ji and Huajie Tan and Jiayu Shi and Xiaoshuai Hao and Yuan Zhang and Hengyuan Zhang and Pengwei Wang and Mengdi Zhao and Yao Mu and Pengju An and Xinda Xue and Qinghang Su and Huaihai Lyu and Xiaolong Zheng and Jiaming Liu and Zhongyuan Wang and Shanghang Zhang},
  journal= {arXiv preprint arXiv:2502.21257},
  year   = {2025}
}