中文

CoMatch:面向双侧亚像素级半密集图像匹配的动态可见性感知 Transformer

计算机视觉与模式识别 2025-04-01 v1

摘要

本前瞻性研究提出了CoMatch,这是一种具备动态可见性感知能力和双侧亚像素精度的新型半密集图像匹配器。首先,观察到由于标记在粗糙特征图上的相邻表示相似性,整个特征图上的上下文交互建模会产生高度冗余的计算,因此引入基于可见性得分的动态标记浓缩器,以适应性地聚合具有不同可见性得分的标记,从而在确保计算效率的同时,同时提升了聚合标记的表征能力。其次,考虑到与大量非可见区域的特征交互会干扰特征区分性,可能降低特征的判别性,部署可见性辅助的注意力机制,以选择性抑制来自非可见性降低标记的无关信息广播, resulting in robust and compact attention to relevant rather than all ones。第三,我们发现,在细粒度阶段,当前方法仅调整目标视图的关键点以达到亚像素水平,而源视图的关键点仍受限制于粗糙水平,因而不够信息丰富,对于关键点位置敏感的应用不利。我们开发了一个简单而强大的细粒度相关模块,用于细化源视图和目标视图中的匹配候选至亚像素水平,实现了引人注目的性能提升。通过在多个公开基准测试上的彻底实验,确认了CoMatch在准确性、效率和通用性方面的前景。

关键词

引用

@article{arxiv.2503.23925,
  title  = {CoMatch: Dynamic Covisibility-Aware Transformer for Bilateral Subpixel-Level Semi-Dense Image Matching},
  author = {Zizhuo Li and Yifan Lu and Linfeng Tang and Shihua Zhang and Jiayi Ma},
  journal= {arXiv preprint arXiv:2503.23925},
  year   = {2025}
}