中文

COMPASS:用于基于平面图的视觉定位的紧凑多通道先验地图与场景签名

计算机视觉与模式识别 2026-04-29 v1 机器人学

摘要

建筑平面图是广泛可用的先验信息,不仅包含环境的几何信息,还包含语义信息,然而现有的定位方法很大程度上忽略了这些语义信息。为解决此问题,我们提出了 COMPASS,这是一种利用平面图中的几何和语义先验来估计配备双鱼眼摄像头的机器人位姿的算法。受基于 LiDAR 的位置识别中的扫描上下文描述符启发,我们设计了一种多通道径向描述符,用于编码位置周围的几何布局。从平面图中,射线被投射到 360 个方位箱中,结果被编码为五个通道:归一化距离、结构命中类型(墙壁、窗户或开口)、距离梯度、距离倒数和局部距离方差。从图像侧,通过检测鱼眼图像中的结构元素来填充相同的描述符结构。作为迈向完整跨模态匹配的第一步,我们提出了一种用于鱼眼图像的窗户检测算法,该算法使用线段检测器通过垂直边缘聚类和亮度验证来识别窗框。检测到的窗户通过鱼眼相机模型投影到方位角上,生成视觉描述符的命中类型通道。作为概念验证,我们从 Hilti-Trimble SLAM Challenge 2026 数据集中的单个已知位姿生成了两种描述符,并证明了从每个相机第一帧提取的墙-窗模式与平面图描述符高度匹配,验证了跨模态结构匹配的可行性。

关键词

引用

@article{arxiv.2604.25388,
  title  = {COMPASS: COmpact Multi-channel Prior-map And Scene Signature for Floor-Plan-Based Visual Localization},
  author = {Muhammad Shaheer and Miguel Fernandez-Cortizas and Asier Bikandi-Noya and Holger Voos and Jose Luis Sanchez-Lopez},
  journal= {arXiv preprint arXiv:2604.25388},
  year   = {2026}
}