基于顺序感知指代的数据高效 3D 视觉定位
计算机视觉与模式识别
2025-02-25 v5
摘要
3D 视觉定位旨在根据自然语言描述,在 3D 点云场景中识别目标物体。以往的工作通常需要大量与点颜色及其描述相关的数据,以利用相应的复杂视觉-语言关系。在本工作中,我们引入了 Vigor,一种通过顺序感知指代实现的新型数据高效 3D 视觉定位框架。Vigor 利用大语言模型从输入描述中生成理想的指代顺序,用于 3D 视觉定位。借助所提出的堆叠式物体指代模块,上述顺序中预测的锚点物体允许逐步定位目标物体,而无需对锚点物体的身份或锚点/目标物体之间的确切关系进行监督。此外,我们提出了一种顺序感知的热身训练策略,该策略通过增强指代顺序来预训练视觉定位框架。这使我们能够更好地捕捉复杂的视觉-语言关系,并受益于理想的数据高效学习方案。在 NR3D 和 ScanRefer 数据集上的实验结果证明了我们在低资源场景下的优越性。特别是,在 NR3D 数据集上,Vigor 在 1% 数据和 10% 数据设置下的定位准确率分别比当前最先进的框架高出 9.3% 和 7.6%。代码公开于 https://github.com/tony10101105/Vigor。
引用
@article{arxiv.2403.16539,
title = {Data-Efficient 3D Visual Grounding via Order-Aware Referring},
author = {Tung-Yu Wu and Sheng-Yu Huang and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:2403.16539},
year = {2025}
}
备注
accepted to WACV 2025