深度学习如何重塑图像配准:综述与展望
计算机视觉与模式识别
2025-06-06 v1
摘要
图像配准通过建立两视图图像之间的对应关系,以恢复 3D 结构和相机几何,是计算机视觉的基石,支撑着包括视觉定位、3D 重建和同时定位与地图(SLAM)等广泛应用。传统管道由“检测器-描述子、特征匹配器、离群点过滤器和几何估计器”组成,在面对挑战性场景时往往不堪一击。近期深度学习的突破显著提升了鲁棒性和精度。这一综述采取独特视角,全面审视深度学习如何逐步变革经典图像配准管道。我们的分类在两个关键方面高度与传统管道一致:i) 用可学习的替代方案取代传统管道的各个步骤,包括可学习的检测器-描述子、离群点过滤器和几何估计器;ii) 将多个步骤合并为可端到端学习的模块,包括中端稀疏匹配器、端到端稠密/半稠密匹配器和位姿回归器。我们首先检视两者的设计原则、优势与局限性,然后在相对位姿恢复、单应性估计和视觉定位任务上对代表性方法进行基准测试。最后,我们讨论了开放性挑战,勾勒出未来研究的有前景的方向。通过系统对深度学习驱动的策略进行分类和评估,这一综述为演变中的图像配准格局提供了清晰概览,并突出了进一步创新的关键途径。
引用
@article{arxiv.2506.04619,
title = {Deep Learning Reforms Image Matching: A Survey and Outlook},
author = {Shihua Zhang and Zizhuo Li and Kaining Zhang and Yifan Lu and Yuxin Deng and Linfeng Tang and Xingyu Jiang and Jiayi Ma},
journal= {arXiv preprint arXiv:2506.04619},
year = {2025}
}