PixSelect:以更少但可靠的像素实现准确高效定位
计算机视觉与模式识别
2023-12-19 v1 机器人学
摘要
准确的相机位姿估计是自动驾驶、移动机器人与增强现实等众多应用的基本需求。本工作中,我们解决在给定环境中从单张RGB图像估计全局6 DoF相机位姿的问题。先前工作认为图像每一部分对定位都有价值。然而,许多图像区域如天空、遮挡与重复不可区分图案无法用于定位。除增加不必要的计算负担外,从此类区域提取并匹配特征会产生许多错误匹配,进而降低定位精度与效率。我们的工作针对此特定问题,并展示通过利用稀疏3D模型这一有趣概念,可发掘具判别性的环境部分并规避无用的图像区域,以服务于单图像定位。有趣的是,通过避免从树木、灌木、汽车、行人与遮挡等不可靠图像区域选取关键点,我们的工作天然充当了离群值滤波器。这使得我们的系统极为高效(仅需极少的对应点集)且极为准确(离群值数量少)。我们的工作在室外Cambridge Landmarks数据集上超越SOTA方法。仅依靠推理时的单张图像,它在精度上胜过那些利用位姿先验和/或参考3D模型的方法,同时速度快得多。通过仅选取少至100个对应点,它超越了从数千对应点定位的同类方法,且更高效。特别地,相较于这些方法,它在OldHospital场景上实现了33%的定位提升。此外,它优于直接位姿回归器,甚至优于那些从图像序列学习的方法。
引用
@article{arxiv.2206.03775,
title = {PixSelect: Less but Reliable Pixels for Accurate and Efficient Localization},
author = {Mohammad Altillawi},
journal= {arXiv preprint arXiv:2206.03775},
year = {2023}
}