是否要粘合?移动映射相机与带纹理语义3D建筑模型之间的图像匹配:经典方法与学习型方法的比较
计算机视觉与模式识别
2025-05-26 v1 机器学习
摘要
特征匹配是许多计算机视觉和测绘应用(如图像配准、结构从运动和视觉定位)的必要步骤。经典手工方法,如SIFT特征检测和描述,结合最近邻匹配和RANSAC剔除异常值,长期以来一直是移动映射相机的前沿技术。尽管近期深度学习技术的进步促进了可学习方法的引入,并在复杂条件下证明其更好的鲁棒性和性能,但针对语义3D建筑相机至模型匹配任务的经典方法与可学习特征匹配方法的系统性比较仍然缺失。本文系统评估了不同特征匹配技术在使用带纹理CityGML LoD2模型进行视觉定位中的有效性。我们使用标准基准数据集(HPatches、MegaDepth-1500)和自定义数据集,后者包含建筑立面纹理及其对应的相机图像(陆地相机和无人机相机)。对于后者,我们评估了使用基于透视点数(PnP)算法估计的绝对姿态精度,几何真值来源于地理参考轨迹数据。结果表明,在我们具有挑战性的自定义数据集上(RANSAC内点数为0至12,ROC曲线下面积为0至0.16),可学习的特征匹配方法在准确性和鲁棒性方面远远优于传统方法。我们认为,这一工作将推动基于模型的视觉定位方法的发展。代码链接:https://github.com/simBauer/To_Glue_or_not_to_Glue
引用
@article{arxiv.2505.17973,
title = {To Glue or Not to Glue? Classical vs Learned Image Matching for Mobile Mapping Cameras to Textured Semantic 3D Building Models},
author = {Simone Gaisbauer and Prabin Gyawali and Qilin Zhang and Olaf Wysocki and Boris Jutzi},
journal= {arXiv preprint arXiv:2505.17973},
year = {2025}
}
备注
Accepted to MMT, Xiamen, China; ISPRS Annals