3D CAVLA:利用深度与三维上下文泛化视觉语言动作模型以应对未知任务
机器人学
2026-03-31 v2 计算机视觉与模式识别
摘要
三维空间中的机器人操作需要有效计算N自由度的关节空间轨迹,以实现精确且鲁棒的控制。为此,机器人必须将语义理解与视觉感知相结合,将真实世界的观测转化为用于物体交互的低级控制。近期,视觉-语言-动作(VLA)模型通过将RGB图像和语言指令映射到任务空间速度,展现了巨大潜力,这些模型通常在大型遥操作演示数据集上进行训练。然而,这些模型往往难以泛化到其训练分布之外的任务。在本工作中,我们提出了3D-CAVLA,一种新颖的微调框架,通过整合三个关键组件来增强VLA策略的任务泛化能力:(i) 用于结构化决策的思维链推理,(ii) 用于三维空间理解的深度感知,以及 (iii) 用于聚焦操作的任务导向感兴趣区域检测。在LIBERO仿真环境中的大量实验表明,3D-CAVLA在多种域内任务套件中取得了98.1%的平均成功率。在未知任务上,3D-CAVLA的成功率绝对提升了8.8%,突显了三维场景感知对鲁棒泛化的益处。我们在真实世界的桌面实验上验证了我们的方法,证明所提出的模型能有效地从仿真迁移到物理机器人。3D-CAVLA的训练收敛速度提高了3倍以上,并在未知的真实世界任务上取得了25%的成功率增益。我们将开源代码和未知任务数据集,以促进社区驱动的研究:https://3d-cavla.github.io。
引用
@article{arxiv.2505.05800,
title = {3D CAVLA: Leveraging Depth and 3D Context to Generalize Vision Language Action Models for Unseen Tasks},
author = {Vineet Bhat and Yu-Hsiang Lan and Prashanth Krishnamurthy and Ramesh Karri and Farshad Khorrami},
journal= {arXiv preprint arXiv:2505.05800},
year = {2026}
}
备注
Accepted at the 1st Workshop on 3D LLM/VLA, CVPR 2025. This work has been submitted to the IEEE for possible publication