中文

BridgeVLA:面向3D操控学习的视觉-语言-动作输入输出对齐

机器人学 2025-10-15 v2 人工智能

摘要

最近,利用预训练视觉-语言模型(VLM)构建视觉-语言-动作(VLA)模型的做法日益引人关注,但仅有少数方法将3D信号融入VLMs用于动作预测,且未充分利用3D数据中固有的空间结构,导致样本效率较低。本文提出BridgeVLA,一种新的3D VLA模型,该模型(1)将3D输入投影到多个2D图像,确保与VLM主干网络对齐,(2)利用2D热图进行动作预测,在一致的2D图像空间中统一输入和输出空间。此外,我们提出了可扩展的预训练方法,使VLM主干网络能够在下游策略学习前预测2D热图。大量实验表明,所提方法能够高效有效地学习3D操控。BridgeVLA在三个仿真基准测试中均优于最新基线方法。在RLBench中,将平均成功率从81.4%提升至88.2%。在COLOSSEUM中,所测试方法在具有挑战性的泛化设置下表现显著更佳,将平均成功率从56.7%提升至64.0%。在GemBench中,BridgeVLA在平均成功率方面超越了所有比较基线方法。在实际机器人实验中,BridgeVLA相对于最新基线方法平均提升32%。该方法在多个分布外设置(包括视觉干扰和未见指令)下具有稳健的泛化能力。值得注意的是,仅凭每个任务3条轨迹,即可实现96.8%的成功率,凸显了其非凡的样本效率。项目网站:https://bridgevla.github.io/

关键词

引用

@article{arxiv.2506.07961,
  title  = {BridgeVLA: Input-Output Alignment for Efficient 3D Manipulation Learning with Vision-Language Models},
  author = {Peiyan Li and Yixiang Chen and Hongtao Wu and Xiao Ma and Xiangnan Wu and Yan Huang and Liang Wang and Tao Kong and Tieniu Tan},
  journal= {arXiv preprint arXiv:2506.07961},
  year   = {2025}
}

备注

NeurIPS 2025