中文

RoboFlamingo-Plus:深度与RGB感知在机器人操作中的融合

机器人学 2025-03-26 v1 人工智能 计算机视觉与模式识别

摘要

随着机器人技术向更复杂的多模态交互和操作任务发展,集成先进的视觉语言模型(VLM)已成为该领域的关键驱动力。尽管已有方法取得了进展,但在3D环境中融合深度和RGB信息以及执行由语言指令引导的任务方面仍面临挑战。为此,我们在现有RoboFlamingo框架基础上增强了该框架,提出RoboFlamingo-Plus,通过融合深度数据显著提高了机器人操作性能。我们的研究通过将预训练的视觉Transformer(ViT)与重采样技术相结合,实现了RGB和深度信息的精细融合,并将此组合数据与语言线索紧密对齐,以实现更优的多模态理解。RoboFlamingo-Plus的新颖之处在于其针对深度数据输入的适配,利用预训练的重采样器进行深度特征提取,并采用跨注意力机制实现最佳特征集成。这些改进使RoboFlamingo-Plus不仅能够深入理解3D环境,还能轻松在具有挑战性的环境中执行复杂的、由语言指导的任务。实验结果表明,RoboFlamingo-Plus在机器人操作中提升了10-20%,标志着重大进展。代码和模型权重已公开于RoboFlamingo-Plus。

关键词

引用

@article{arxiv.2503.19510,
  title  = {RoboFlamingo-Plus: Fusion of Depth and RGB Perception with Vision-Language Models for Enhanced Robotic Manipulation},
  author = {Sheng Wang},
  journal= {arXiv preprint arXiv:2503.19510},
  year   = {2025}
}