中文

面向 3D 视觉定位的文本引导方法综述: 元素、最新进展与未来方向

计算机视觉与模式识别 2024-07-23 v2

摘要

文本引导 3D 视觉定位 (T-3DVG) 旨在从复杂的 3D 场景中定位与语言查询在语义上对应的特定对象, 近年来在 3D 研究社区中引起日益关注。与 2D 视觉定位相比, 该任务因其更贴近现实世界且数据收集和 3D 点云源处理复杂而具有巨大的潜力和挑战。本综述旨在提供 T-3DVG 进展的全面概述, 包括其基本元素、最新研究进展和未来研究方向。据我们所知, 这是首个系统性地针对 T-3DVG 任务进行综述。具体而言, 我们首先以教程式方式提供 T-3DVG 流程的通用结构, 并详细阐述各组成部分, 给出完整的背景概述。随后, 我们将现有的 T-3DVG 方法归纳为不同类别, 并分析其优势与不足。我们还呈现了基准数据集和评估指标以评估其性能。最后, 我们讨论了现有 T-3DVG 方法的潜在局限性, 并分享一些关于几个有前景的研究方向的见解。最新论文可在 https://github.com/liudaizong/Awesome-3D-Visual-Grounding 持续收集。

关键词

引用

@article{arxiv.2406.05785,
  title  = {A Survey on Text-guided 3D Visual Grounding: Elements, Recent Advances, and Future Directions},
  author = {Daizong Liu and Yang Liu and Wencan Huang and Wei Hu},
  journal= {arXiv preprint arXiv:2406.05785},
  year   = {2024}
}