中文

REMM:面向端到端多模态图像匹配的旋转等变框架

计算机视觉与模式识别 2024-07-17 v1

摘要

我们提出了REMM(Rotation-Equivariant Multimodal Matching),一个面向端到端多模态图像匹配的旋转等变框架,完整地编码了匹配流程中描述子的旋转差异。以往的基于学习的方法主要关注提取模态不变描述子,而持续忽略了旋转不变性。本文证明,我们的REMM对多模态图像匹配非常有用,包括多模态特征学习模块和循环位移模块。我们首先通过多模态特征学习模块学习模态不变特征。然后,我们设计循环位移模块来对描述子进行旋转编码,大幅提高了旋转等变匹配性能,使其对任意角度都具有鲁棒性。为验证我们的方法,我们构建了一个综合的旋转和尺度匹配基准,用于评估多模态图像的抗旋转性能,该基准包含来自四个公开数据集的多角度和多尺度变换的组合。大量实验表明,我们的方法在基准测试中超越了现有方法,并能良好地泛化到独立数据集。此外,我们对REMM的关键组件进行了深入分析,以验证循环位移模块带来的改进。代码和数据集已公开于 https://github.com/HanNieWHU/REMM。

关键词

引用

@article{arxiv.2407.11637,
  title  = {REMM:Rotation-Equivariant Framework for End-to-End Multimodal Image Matching},
  author = {Han Nie and Bin Luo and Jun Liu and Zhitao Fu and Weixing Liu and Xin Su},
  journal= {arXiv preprint arXiv:2407.11637},
  year   = {2024}
}

备注

13 pages, 13 figures