中文

面向免训练三维视觉定位的语言到空间编程

计算机视觉与模式识别 2025-08-29 v4

摘要

三维视觉定位(3DVG)因需要理解三维空间关系而具有挑战性。虽然有监督方法取得了优越的性能,但它们受到三维视觉-语言数据集稀缺和高昂标注成本的限制。基于LLM/VLM的无训练方法消除了对大规模训练数据的需求,但它们要么导致过高的定位时间和令牌成本,要么精度不尽人意。为了应对这些挑战,我们引入了一种新颖的无训练三维视觉定位方法,即语言到空间编程(LaSP)。LaSP引入了LLM生成的代码来分析物体间的三维空间关系,并配备了一个自动评估和优化这些代码的流程。实验结果表明,LaSP在Nr3D基准测试上达到了52.9%的准确率,跻身最佳无训练方法之列。此外,它显著减少了定位时间和令牌成本,在性能和效率之间提供了平衡的权衡。

关键词

引用

@article{arxiv.2502.01401,
  title  = {Language-to-Space Programming for Training-Free 3D Visual Grounding},
  author = {Boyu Mi and Hanqing Wang and Tai Wang and Yilun Chen and Jiangmiao Pang},
  journal= {arXiv preprint arXiv:2502.01401},
  year   = {2025}
}