中文

紧盯差距:将视觉基础模型对齐到图像特征匹配

计算机视觉与模式识别 2025-07-15 v1

摘要

利用视觉基础模型已成为提升图像特征匹配性能的主流范式。然而,前人工作在引入基础模型进行特征匹配时忽略了对齐问题。这种对齐差异源于基础模型侧重单张图像理解,而特征匹配要求跨图像理解。具体而言:1)常用基础模型提取的嵌入向量与特征匹配所需的优化嵌入向量存在差异;2)缺乏有效机制将单图像理解能力转化为跨图像理解能力。对齐差异的一个显著后果是,在处理多实例特征匹配问题时难以应对。为解决此问题,我们提出一种简单而有效的框架,称为 IMD(Image feature Matching with a pre-trained Diffusion model),包含两个部分:1)不同于主流采用基于对比学习的基础模型强调全局语义的方法,我们集成基于扩散模型的生成式模型,以有效捕获实例级细节。2)我们利用生成式模型中的提示机制作为天然的通道,提出一种新颖的跨图像交互提示模块,以促进图像对之间的双向信息交互。为更准确地衡量对齐差异,我们提出了一个新基准测试,称为 IMIM,专注于多实例场景。我们提出的 IMD 在常用评估基准上取得最新状态的突破,12% 的显著提升表明我们有效缓解了对齐差异。

关键词

引用

@article{arxiv.2507.10318,
  title  = {Mind the Gap: Aligning Vision Foundation Models to Image Feature Matching},
  author = {Yuhan Liu and Jingwen Fu and Yang Wu and Kangyi Wu and Pengna Li and Jiayi Wu and Sanping Zhou and Jingmin Xin},
  journal= {arXiv preprint arXiv:2507.10318},
  year   = {2025}
}

备注

Accepted by ICCV 2025