面向相机定位的改进场景地标检测
计算机视觉与模式识别
2024-02-01 v1 机器人学
摘要
基于检索、局部特征匹配和三维结构姿态估计的相机定位方法精度高,但存储需求大、速度慢且不保护隐私。最近提出的一种基于场景地标检测(SLD)的方法旨在解决这些局限性。该方法训练一个卷积神经网络(CNN)来检测少数预定的、显著的、场景特定的三维点或地标,并从关联的二维-三维对应关系中计算相机姿态。尽管 SLD 优于现有的基于学习的方法,但其精度明显低于基于三维结构的方法。在本文中,我们表明精度差距是由于模型容量不足和训练期间的噪声标签造成的。为了缓解容量问题,我们提出将地标分成子组,并为每个子组训练一个独立的网络。为了生成更好的训练标签,我们提出使用稠密重建来估计场景地标的可见性。最后,我们提出一种紧凑的架构以提高内存效率。在精度方面,我们的方法在 INDOOR-6 数据集上与最先进的基于结构的方法相当,但运行速度显著更快,且使用的存储更少。代码和模型可在 https://github.com/microsoft/SceneLandmarkLocalization 找到。
引用
@article{arxiv.2401.18083,
title = {Improved Scene Landmark Detection for Camera Localization},
author = {Tien Do and Sudipta N. Sinha},
journal= {arXiv preprint arXiv:2401.18083},
year = {2024}
}
备注
To be presented at 3DV 2024