中文

RoboBERT:端到端多模态机器人操作模型

机器人学 2025-05-02 v2 机器学习

摘要

具身智能无缝整合了视觉、语言和动作。然而,大多数多模态机器人模型依赖大规模微调,产生高昂的时间和硬件成本。为了解决这个问题,我们引入了 RoboBERT,一个围绕新颖的两阶段训练范式构建的端到端多模态操作模型。在第一阶段,我们冻结大部分视觉编码器并使用单一“标准”指令表述进行训练,使模型能够通过基于 CNN 的扩散策略专注于稳定的策略学习。在第二阶段,我们解冻所有模块并注入多样化的自然语言变体,在不破坏性能稳定性的情况下,快速将各种指令与已学习的策略对齐。我们进一步采用系统化的数据增强,以增强对视觉扰动的鲁棒性。在不依赖辅助数据集的情况下,RoboBERT 仅使用语言标记的专家演示和相对轻量级的架构,在 CALVIN ABCD-D 基准上实现了 4.52 的新 SOTA 平均回合长度,在 ABC-D 基准上实现了 3.79。在 6 自由度机械臂上的真实机器人试验证实,其成功率高于在相同数据上训练的同类方法。这些结果表明,我们由数据增强增强的两阶段训练范式为多模态机器人系统提供了高效、可扩展且广泛适用的性能。

关键词

引用

@article{arxiv.2502.07837,
  title  = {RoboBERT: An End-to-end Multimodal Robotic Manipulation Model},
  author = {Sicheng Wang and Sheng Liu and Weiheng Wang and Jianhua Shan and Bin Fang},
  journal= {arXiv preprint arXiv:2502.07837},
  year   = {2025}
}