VLA-LPAF:轻量级视角自适应融合用于视觉-语言-动作以实现更自由的机器人操控
计算机视觉与模式识别
2025-09-24 v1 人工智能
摘要
视觉-语言-动作(VLA)模型可根据对周围环境的视觉观察遵循文本指令。这种将多模态输入映射到动作的能力源于VLA模型在大量标准演示上的训练。这些由第三人称全局相机和腕部局部相机捕获的视觉观察在不同环境中不可避免地在数量和视角上各不相同,导致视觉特征存在显著差异。这种视角异质性限制了VLA模型的通用性。基于此,我们首先提出了轻量级模块VLA-LPAF,仅使用2D数据来促进VLA模型的视角自适应能力。VLA-LPAF使用单视角图像进行微调,并在潜在空间中融合其他多视角观察,从而有效且高效地弥合由视角不一致造成的差距。我们以VLA模型RoboFlamingo为基础实例化了VLA-LPAF框架,构建了RoboFlamingo-LPAF。实验表明,RoboFlamingo-LPAF在CALVIN上平均实现了约8%的任务成功率提升,在LIBERO上提升了15%,在定制仿真基准上提升了30%。我们还通过真实世界任务展示了所提出的RoboFlamingo-LPAF的视角自适应特性。
引用
@article{arxiv.2509.18183,
title = {VLA-LPAF: Lightweight Perspective-Adaptive Fusion for Vision-Language-Action to Enable More Unconstrained Robotic Manipulation},
author = {Jinyue Bian and Zhaoxing Zhang and Zhengyu Liang and Shiwei Zheng and Shengtao Zhang and Rong Shen and Chen Yang and Anzhou Hou},
journal= {arXiv preprint arXiv:2509.18183},
year = {2025}
}