用于视觉地点识别的深度单应性估计
计算机视觉与模式识别
2024-04-09 v2 人工智能
摘要
视觉地点识别(VPR)是机器人定位和增强现实等许多应用的基本任务。近年来,分层VPR方法由于在准确性和效率之间的权衡而受到广泛关注。它们通常首先使用全局特征检索候选图像,然后验证匹配局部特征的空间一致性以进行重排序。然而,后者通常依赖于RANSAC算法来拟合单应性,这既耗时又不可微。这使得现有方法只能妥协于仅在全局特征提取中训练网络。本文提出了一种基于Transformer的深度单应性估计(DHE)网络,该网络以骨干网络提取的密集特征图为输入,拟合单应性以实现快速且可学习的几何验证。此外,我们设计了一个内点重投影误差损失函数,无需额外的单应性标签即可训练DHE网络,并且该网络还可以与骨干网络联合训练,以帮助其提取更适合局部匹配的特征。在基准数据集上的大量实验表明,我们的方法可以优于几种最先进的方法。并且它比使用RANSAC的主流分层VPR方法快一个数量级以上。代码发布在https://github.com/Lu-Feng/DHE-VPR。
引用
@article{arxiv.2402.16086,
title = {Deep Homography Estimation for Visual Place Recognition},
author = {Feng Lu and Shuting Dong and Lijun Zhang and Bingxi Liu and Xiangyuan Lan and Dongmei Jiang and Chun Yuan},
journal= {arXiv preprint arXiv:2402.16086},
year = {2024}
}
备注
Accepted by AAAI2024