中文

MIFNet:用于通用性多模态图像匹配的模态无关特征学习网络

计算机视觉与模式识别 2025-06-25 v3

摘要

许多关键点检测和描述方法已被提出用于图像匹配或配准。虽然这些方法在单模态图像匹配方面表现出色,但常常在多模态数据上难以胜任,因为训练于单模态数据的描述子往往缺乏对多模态数据中非线性变化的鲁棒性。将此类方法扩展到多模态图像匹配通常需要精确对齐的多模态数据以学习模态无关的描述子。然而,在许多实际场景中获取此类数据往往成本高昂且不切实际。为此,我们提出了一种模态无关特征学习网络(MIFNet),以仅使用单模态训练数据即可为多模态图像匹配中的关键点描述计算模态无关特征。具体而言,我们提出了一种新颖的潜在特征聚合模块和累积混合聚合模块,通过利用来自稳定扩散模型的预训练特征来增强在单模态数据上训练的基本关键点描述子。%我们的 approach 生成跨越多样且未知模态的鲁棒且模态无关的特征。我们在三个多模态视网膜图像数据集(CF-FA、CF-OCT、EMA-OCTA)和两个遥感数据集(Optical-SAR 和 Optical-NIR)上验证了该方法。广泛的实验结果表明,所提出的 MIFNet 能够在不访问目标模态的情况下学习模态无关特征,并且具有良好的零样本泛化能力。代码将在 https://github.com/lyp-deeplearning/MIFNet 上发布。

关键词

引用

@article{arxiv.2501.11299,
  title  = {MIFNet: Learning Modality-Invariant Features for Generalizable Multimodal Image Matching},
  author = {Yepeng Liu and Zhichao Sun and Baosheng Yu and Yitian Zhao and Bo Du and Yongchao Xu and Jun Cheng},
  journal= {arXiv preprint arXiv:2501.11299},
  year   = {2025}
}

备注

Accept by IEEE TIP 2025