中文

SpatiaLoc:基于多层次空间增强描述器的跨模态定位

计算机视觉与模式识别 2026-01-08 v1

摘要

利用文本和点云进行跨模态定位,使机器人能够通过自然语言描述来完成自身定位,具有在自动导航和人机交互方面的应用前景。在该任务中,对象在文本和点云之间经常重复出现,使空间关系成为最具辨识度的定位线索。基于这一特征,我们提出了SpatiaLoc框架,采用粗到细的策略,在实例级和全局级均强调空间关系。在粗阶段,我们引入了基于二次贝塞尔曲线建模实例级空间关系的Bezier增强对象空间编码器(BEOSE)。此外,频率感知编码器(FAE)在全局层面生成频域中的空间表示。在细阶段, 不确定性感知高斯细化器(UGFL)通过建模为具有不确定性感知损失函数的高斯分布来回归2D位置。在KITTI360Pose上进行的大量实验表明,SpatiaLoc显著优于现有的方法。

关键词

引用

@article{arxiv.2601.03579,
  title  = {SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization},
  author = {Tianyi Shang and Pengjie Xu and Zhaojun Deng and Zhenyu Li and Zhicong Chen and Lijun Wu},
  journal= {arXiv preprint arXiv:2601.03579},
  year   = {2026}
}