StereoVLA:利用立体视觉增强视觉-语言-动作模型
机器人学
2025-12-29 v1
摘要
立体相机密切模拟人类双目视觉,为精确的机器人操作提供关键的丰富空间线索。尽管立体视觉具有优势,但其在视觉-语言-动作模型(VLA)中的应用仍未得到充分探索。在本工作中,我们提出了 StereoVLA,一种利用立体视觉中丰富几何线索的 VLA 模型。我们提出了一个新颖的几何-语义特征提取模块,利用视觉基础模型提取并融合两个关键特征:1)来自细微立体视图差异的几何特征,用于空间感知;2)来自单目视图的丰富语义特征,用于指令跟随。此外,我们提出了一个辅助的交互区域深度估计任务,以进一步增强空间感知并加速模型收敛。大量实验表明,在立体设置下的多样化任务中,我们的方法大幅优于基线,并对相机姿态变化表现出很强的鲁棒性。
关键词
引用
@article{arxiv.2512.21970,
title = {StereoVLA: Enhancing Vision-Language-Action Models with Stereo Vision},
author = {Shengliang Deng and Mi Yan and Yixin Zheng and Jiayi Su and Wenhao Zhang and Xiaoguang Zhao and Heming Cui and Zhizheng Zhang and He Wang},
journal= {arXiv preprint arXiv:2512.21970},
year = {2025}
}