中文

3D-Mix for VLA:集成VGGT-based 3D 信息的即插即用模块

机器人学 2026-03-26 v1

摘要

Vision-Language-Action (VLA) 模型利用多模态大语言模型 (MLLM) 进行机器人控制,但近期研究表明 MLLM 由于主要基于2D数据进行训练,导致空间智能有限,难以有效感知进行操作任务的3D空间。虽然近期方法尝试引入如VGGT等专用3D视觉模型以增强空间理解,但它们采用多样化的集成机制,且尚未进行系统性探讨,导致最佳融合策略不明确。我们进行了一项综合性的初步研究,通过在标准化基准测试上比较九种VGGT集成方案,发现语义条件门控融合方案(semantic-conditioned gated fusion)能够基于任务上下文自适应地平衡2D语义特征与3D几何特征,在九种方案中实现了最佳性能。我们提出3D-Mix,一个可集成到各种VLA架构(GR00T 式和π 式)中的即插即用模块,无需修改现有的MLLM或动作专家组件。在SIMPLER和LIBERO上的实验表明,3D-Mix在所有九种GR00T式变体中均能实现持续的性能提升,在OOD SIMPLER基准上平均提升7.0%,为增强VLA系统的空间智能提供了原则化方法。

关键词

引用

@article{arxiv.2603.24393,
  title  = {3D-Mix for VLA: A Plug-and-Play Module for Integrating VGGT-based 3D Information into Vision-Language-Action Models},
  author = {Bin Yu and Shijie Lian and Xiaopeng Lin and Zhaolong Shen and Yuliang Wei and Haishan Liu and Changti Wu and Hang Yuan and Bailing Wang and Cong Huang and Kai Chen},
  journal= {arXiv preprint arXiv:2603.24393},
  year   = {2026}
}

备注

13 pages