VLM-Grounder:用于零样本3D视觉定位的VLM智能体
计算机视觉与模式识别
2024-10-18 v1 机器人学
摘要
3D视觉定位对机器人至关重要,需要整合自然语言和3D场景理解。依赖于3D点云监督学习的传统方法受到稀缺数据集的限制。最近,提出了利用大语言模型(LLMs)的零样本方法来解决数据问题。虽然有效,但这些方法仅使用以对象为中心的信息,限制了它们处理复杂查询的能力。在这项工作中,我们提出了VLM-Grounder,一个新颖的框架,它使用视觉语言模型(VLMs)仅基于2D图像进行零样本3D视觉定位。VLM-Grounder动态拼接图像序列,采用定位和反馈方案来查找目标对象,并使用多视图集成投影来精确估计3D边界框。在ScanRefer和Nr3D数据集上的实验表明,VLM-Grounder优于先前的零样本方法,在ScanRefer上达到51.6%的[email protected],在Nr3D上达到48.0%的Acc,且不依赖3D几何或对象先验。代码可在https://github.com/OpenRobotLab/VLM-Grounder获取。
引用
@article{arxiv.2410.13860,
title = {VLM-Grounder: A VLM Agent for Zero-Shot 3D Visual Grounding},
author = {Runsen Xu and Zhiwei Huang and Tai Wang and Yilun Chen and Jiangmiao Pang and Dahua Lin},
journal= {arXiv preprint arXiv:2410.13860},
year = {2024}
}
备注
CoRL 2024 Camera Ready. 25 pages. A novel zero-shot 3D visual grounding framework based solely on 2D images