中文

基于黎曼与辛几何的层次化文本驱动地点识别

计算机视觉与模式识别 2026-04-03 v1

摘要

文本到点云定位使机器人能够通过自然语言描述理解空间位置,这对自动驾驶和最后一公里配送等应用中的人机协作至关重要。然而,现有方法采用池化的全局描述符进行相似性检索,这会导致严重的信息丢失,并且无法捕捉具有判别性的场景结构。为了解决这些问题,我们提出了SympLoc,一个新颖的粗到细定位框架,在粗阶段具有多层对齐。与仅依赖全局描述符的先前方法不同,我们的粗阶段由三个互补的对齐层级组成:1) 实例级对齐通过双曲空间中的黎曼自注意力在点云中的单个对象实例与文本提示之间建立直接对应关系;2) 关系级对齐使用信息-辛关系编码器(ISRE)显式建模对象之间的成对空间关系,该编码器通过Fisher-Rao度量和哈密顿动力学重构关系特征,以实现不确定性感知的几何一致性传播;3) 全局级对齐通过谱流形变换(SMT)综合具有判别性的全局描述符,该变换通过图谱分析提取结构不变量。这种层次化对齐策略逐步捕捉从细粒度到粗粒度的场景语义,实现稳健的跨模态检索。在KITTI360Pose数据集上的广泛实验表明,SympLoc相比现有最先进方法在Top-1 recall@10m上取得了19%的提升。

关键词

引用

@article{arxiv.2604.01598,
  title  = {Riemannian and Symplectic Geometry for Hierarchical Text-Driven Place Recognition},
  author = {Tianyi Shang and Zhenyu Li},
  journal= {arXiv preprint arXiv:2604.01598},
  year   = {2026}
}

备注

9 pages