中文

StereoVLA:利用立体视觉增强视觉-语言-动作模型

机器人学 2025-12-29 v1

摘要

立体相机密切模拟人类双目视觉,为精确的机器人操作提供关键的丰富空间线索。尽管立体视觉具有优势,但其在视觉-语言-动作模型(VLA)中的应用仍未得到充分探索。在本工作中,我们提出了 StereoVLA,一种利用立体视觉中丰富几何线索的 VLA 模型。我们提出了一个新颖的几何-语义特征提取模块,利用视觉基础模型提取并融合两个关键特征:1)来自细微立体视图差异的几何特征,用于空间感知;2)来自单目视图的丰富语义特征,用于指令跟随。此外,我们提出了一个辅助的交互区域深度估计任务,以进一步增强空间感知并加速模型收敛。大量实验表明,在立体设置下的多样化任务中,我们的方法大幅优于基线,并对相机姿态变化表现出很强的鲁棒性。

关键词

引用

@article{arxiv.2512.21970,
  title  = {StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision},
  author = {Shengliang Deng and Mi Yan and Yixin Zheng and Jiayi Su and Wenhao Zhang and Xiaoguang Zhao and Heming Cui and Zhizheng Zhang and He Wang},
  journal= {arXiv preprint arXiv:2512.21970},
  year   = {2025}
}