中文

EmbodiedMAE:用于机器人操控的统一三维多模态表示

机器人学 2025-05-16 v1 人工智能

摘要

我们提出 EmbodiedMAE,一种用于机器人操控的统一三维多模态表示。现有方法在训练数据集与机器人操控任务之间存在显著的领域差距,同时缺乏能有效融合三维信息的模型架构。为克服这些限制,我们在 DROID 数据集上增加了高质量深度图和点云,构建了 DROID-3D 作为三维具身视觉研究的有益补充。随后我们开发了 EmbodiedMAE,一种多模态掩码自编码器,通过随机掩码和跨模态融合同时学习 RGB、深度和点云模态的表示。在 DROID-3D 上训练后,EmbodiedMAE 在两个机器人平台的 70 个模拟任务和 20 个真实机器人操控任务中,始终在训练效率和最终性能上优于最先进的视觉基础模型(VFMs)。该模型展现出随规模增长的强扩展性,并能有效促进从三维输入进行策略学习。实验结果确立了 EmbodiedMAE 作为具身 AI 系统中可靠的统一三维多模态 VFM 的地位,尤其在空间感知至关重要的精确桌面操控场景中。

关键词

引用

@article{arxiv.2505.10105,
  title  = {EmbodiedMAE: A Unified 3D Multi-Modal Representation for Robot Manipulation},
  author = {Zibin Dong and Fei Ni and Yifu Yuan and Yinchuan Li and Jianye Hao},
  journal= {arXiv preprint arXiv:2505.10105},
  year   = {2025}
}