中文

Text2Loc++: 从自然语言泛化3D点云定位

计算机视觉与模式识别 2025-11-20 v1

摘要

我们解决了使用复杂多样化的自然语言描述对3D点云子图进行定位的问题,提出了Text2Loc++,一个用于在粗到细定位管道中实现语言与点云之间有效跨模态对齐的新型神经网络。为支持基准测试,我们引入了一个新的城市规模数据集,涵盖来自多样化城市场景的彩色和非彩色点云,并将位置描述组织为三层语言复杂度。在全局位置识别阶段,Text2Loc++将预训练语言模型与基于最大池的层次化Transformer(HTM)结合,用于句子级语义,并采用注意力机制的点云编码器进行空间理解。我们进一步提出了遮蔽实例训练(MIT)以过滤掉非对齐的物体并提高多模态鲁棒性。为增强嵌入空间,我们引入了模态感知的层次对比学习(MHCL),包括跨模态、子图、文本和实例级别的损失。在细定位阶段,我们完全移除显式的文本-实例匹配,设计一个轻量且强大的框架,基于原型地图克隆(PMC)和级联交叉注意力Transformer(CCAT)。在KITTI360Pose数据集上的大量实验表明,Text2Loc++相对于现有方法提升了最高可达15%。此外,所提出的模型在新数据集上表现出健壮的泛化能力,有效处理复杂的语言表达和多种城市环境。代码和数据集将公开提供。

关键词

引用

@article{arxiv.2511.15308,
  title  = {Text2Loc++: Generalizing 3D Point Cloud Localization from Natural Language},
  author = {Yan Xia and Letian Shi and Yilin Di and Joao F. Henriques and Daniel Cremers},
  journal= {arXiv preprint arXiv:2511.15308},
  year   = {2025}
}

备注

This paper builds upon and extends our earlier conference paper Text2Loc presented at CVPR 2024