中文

Text2Loc:基于自然语言的三维点云定位

计算机视觉与模式识别 2024-03-29 v2

摘要

我们解决了基于少量自然语言描述的三维点云定位问题,并引入了一种新颖神经网络Text2Loc,其充分解析点与文本之间的语义关系。Text2Loc遵循由粗到细的定位流程:文本-子图全局地点识别,随后进行精细定位。在全局地点识别中,各文本提示间的关联动态在带最大池化的分层Transformer(HTM)中被捕获,而正负样本对的平衡通过文本-子图对比学习维持。此外,我们提出了一种新颖的无匹配精细定位方法以进一步精炼位置预测,其完全去除了复杂的文本-实例匹配需求,且比先前方法更轻量、更快、更准确。大量实验表明,在KITTI360Pose数据集上Text2Loc将定位精度较最先进水平(SOTA)提升了高达2倍。我们的项目页面公开于 \url{https://yan-xia.github.io/projects/text2loc/}。

关键词

引用

@article{arxiv.2311.15977,
  title  = {Text2Loc: 3D Point Cloud Localization from Natural Language},
  author = {Yan Xia and Letian Shi and Zifeng Ding and João F. Henriques and Daniel Cremers},
  journal= {arXiv preprint arXiv:2311.15977},
  year   = {2024}
}

备注

Accepted by CVPR 2024