模态感知特征匹配:单模态和跨模态技术的综合综述
计算机视觉与模式识别
2025-07-31 v1
摘要
特征匹配是计算机视觉中的核心任务,essential for applications such as image retrieval, stereo matching, 3D reconstruction, and SLAM. 本综述全面综述了基于模态的特征匹配,探讨了传统手工方法并强调了 various modalities 包括 RGB 图像、深度图像、3D 点云、LiDAR 扫描、医学图像和视觉-语言交互的当代深度学习方法. 传统方法利用 Harris 角点和 SIFT、ORB 等描述符, demonstrate 在 moderate intra-modality 变化下具有鲁棒性,但在 significant modality 间隙方面受限. 当代深度学习方法, 以 CNN 基于 SuperPoint 和 transformer-based LoFTR 等无探测器策略为例, substantial improvement 在跨模态鲁棒性和 adaptivity. 我们 highlight 模态感知的进展,例如用于深度图像的几何和深度-specific 描述符,用于 3D 点云的稀疏和稠密学习方法,用于 LiDAR 扫描的 attention-enhanced 神经网络,以及用于复杂医学图像匹配的 specialized 解决方案如 MIND 描述符. 跨模态应用,特别是在医学图像配准和视觉-语言任务中, underscore feature matching 的演化以处理日益多样化的数据 interaction.
引用
@article{arxiv.2507.22791,
title = {Modality-Aware Feature Matching: A Comprehensive Review of Single- and Cross-Modality Techniques},
author = {Weide Liu and Wei Zhou and Jun Liu and Ping Hu and Jun Cheng and Jungong Han and Weisi Lin},
journal= {arXiv preprint arXiv:2507.22791},
year = {2025}
}