中文

基于顺序感知指代的数据高效 3D 视觉定位

计算机视觉与模式识别 2025-02-25 v5

摘要

3D 视觉定位旨在根据自然语言描述,在 3D 点云场景中识别目标物体。以往的工作通常需要大量与点颜色及其描述相关的数据,以利用相应的复杂视觉-语言关系。在本工作中,我们引入了 Vigor,一种通过顺序感知指代实现的新型数据高效 3D 视觉定位框架。Vigor 利用大语言模型从输入描述中生成理想的指代顺序,用于 3D 视觉定位。借助所提出的堆叠式物体指代模块,上述顺序中预测的锚点物体允许逐步定位目标物体,而无需对锚点物体的身份或锚点/目标物体之间的确切关系进行监督。此外,我们提出了一种顺序感知的热身训练策略,该策略通过增强指代顺序来预训练视觉定位框架。这使我们能够更好地捕捉复杂的视觉-语言关系,并受益于理想的数据高效学习方案。在 NR3D 和 ScanRefer 数据集上的实验结果证明了我们在低资源场景下的优越性。特别是,在 NR3D 数据集上,Vigor 在 1% 数据和 10% 数据设置下的定位准确率分别比当前最先进的框架高出 9.3% 和 7.6%。代码公开于 https://github.com/tony10101105/Vigor。

关键词

引用

@article{arxiv.2403.16539,
  title  = {Data-Efficient 3D Visual Grounding via Order-Aware Referring},
  author = {Tung-Yu Wu and Sheng-Yu Huang and Yu-Chiang Frank Wang},
  journal= {arXiv preprint arXiv:2403.16539},
  year   = {2025}
}

备注

accepted to WACV 2025