面向零样本开放词汇三维视觉定位的视觉编程方法
计算机视觉与模式识别
2024-03-26 v2
摘要
三维视觉定位(3DVG)旨在根据文本描述定位三维物体。传统的监督式3DVG方法往往需要大量标注和预定义词汇表,这具有局限性。为解决此问题,我们提出了一种新颖的视觉编程方法,用于零样本开放词汇3DVG,充分利用大语言模型(LLMs)的能力。我们的方法首先采用一种独特的基于对话的方法,与LLMs交互以建立对零样本3DVG的基础理解。在此基础上,我们设计了一个视觉程序,由三类模块组成,即视角无关模块、视角相关模块和功能模块。这些专为三维场景定制的模块协同工作,执行复杂的推理与推断。此外,我们开发了一种创新的语言-物体关联模块,将现有三维物体检测器的适用范围扩展到开放词汇场景。大量实验表明,我们的零样本方法可以优于某些监督基线,标志着向高效3DVG迈出了重要一步。
引用
@article{arxiv.2311.15383,
title = {Visual Programming for Zero-shot Open-Vocabulary 3D Visual Grounding},
author = {Zhihao Yuan and Jinke Ren and Chun-Mei Feng and Hengshuang Zhao and Shuguang Cui and Zhen Li},
journal= {arXiv preprint arXiv:2311.15383},
year = {2024}
}
备注
Accepted by CVPR 2024, project website: https://curryyuan.github.io/ZSVG3D/