将零样本3D视觉定位问题形式化为约束满足问题
计算机视觉与模式识别
2025-08-12 v2
摘要
3D视觉定位(3DVG)旨在定位3D场景中的目标对象。监督式方法已取得相当好的准确率,但具有封闭词汇表和有限的语言理解能力。零样本方法利用大语言模型(LLM)处理自然语言描述,LLM要么直接产生定位结果,要么生成计算结果的程序(符号化)。本文提出一种零样本方法,将3DVG任务重新表述为约束满足问题(CSP),其中变量和约束分别代表对象及其空间关系。这使得能够对所有相关对象进行全局符号推理,从而产生目标和锚点对象的定位结果。此外,我们展示了该框架的灵活性,仅通过少量额外编码 effort 即可处理否定式和计数式查询。我们的系统,约束满足视觉定位(CSVG),在ScanRefer和Nr3D数据集上进行了广泛评估,仅使用开源LLM。结果表明CSVG有效且在当前最先进的零样本3DVG方法中表现出优越的定位准确率,分别在ScanRefer和Nr3D数据集上分别提高了([email protected]得分)和。我们的系统代码已公开,访问地址为https://asig-x.github.io/csvg_web。
引用
@article{arxiv.2411.14594,
title = {Solving Zero-Shot 3D Visual Grounding as Constraint Satisfaction Problems},
author = {Qihao Yuan and Kailai Li and Jiaming Zhang},
journal= {arXiv preprint arXiv:2411.14594},
year = {2025}
}