中文

VLM-Grounder:用于零样本3D视觉定位的VLM智能体

计算机视觉与模式识别 2024-10-18 v1 机器人学

摘要

3D视觉定位对机器人至关重要,需要整合自然语言和3D场景理解。依赖于3D点云监督学习的传统方法受到稀缺数据集的限制。最近,提出了利用大语言模型(LLMs)的零样本方法来解决数据问题。虽然有效,但这些方法仅使用以对象为中心的信息,限制了它们处理复杂查询的能力。在这项工作中,我们提出了VLM-Grounder,一个新颖的框架,它使用视觉语言模型(VLMs)仅基于2D图像进行零样本3D视觉定位。VLM-Grounder动态拼接图像序列,采用定位和反馈方案来查找目标对象,并使用多视图集成投影来精确估计3D边界框。在ScanRefer和Nr3D数据集上的实验表明,VLM-Grounder优于先前的零样本方法,在ScanRefer上达到51.6%的[email protected],在Nr3D上达到48.0%的Acc,且不依赖3D几何或对象先验。代码可在https://github.com/OpenRobotLab/VLM-Grounder获取。

关键词

引用

@article{arxiv.2410.13860,
  title  = {VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding},
  author = {Runsen Xu and Zhiwei Huang and Tai Wang and Yilun Chen and Jiangmiao Pang and Dahua Lin},
  journal= {arXiv preprint arXiv:2410.13860},
  year   = {2024}
}

备注

CoRL 2024 Camera Ready. 25 pages. A novel zero-shot 3D visual grounding framework based solely on 2D images