SpatiaLoc:基于多层次空间增强描述器的跨模态定位
计算机视觉与模式识别
2026-01-08 v1
摘要
利用文本和点云进行跨模态定位,使机器人能够通过自然语言描述来完成自身定位,具有在自动导航和人机交互方面的应用前景。在该任务中,对象在文本和点云之间经常重复出现,使空间关系成为最具辨识度的定位线索。基于这一特征,我们提出了SpatiaLoc框架,采用粗到细的策略,在实例级和全局级均强调空间关系。在粗阶段,我们引入了基于二次贝塞尔曲线建模实例级空间关系的Bezier增强对象空间编码器(BEOSE)。此外,频率感知编码器(FAE)在全局层面生成频域中的空间表示。在细阶段, 不确定性感知高斯细化器(UGFL)通过建模为具有不确定性感知损失函数的高斯分布来回归2D位置。在KITTI360Pose上进行的大量实验表明,SpatiaLoc显著优于现有的方法。
引用
@article{arxiv.2601.03579,
title = {SpatiaLoc: Leveraging Multi-Level Spatial Enhanced Descriptors for Cross-Modal Localization},
author = {Tianyi Shang and Pengjie Xu and Zhaojun Deng and Zhenyu Li and Zhicong Chen and Lijun Wu},
journal= {arXiv preprint arXiv:2601.03579},
year = {2026}
}