中文

MatchAttention:匹配相对位置以实现高分辨率跨视角匹配

计算机视觉与模式识别 2025-11-14 v2

摘要

跨视角匹配从根本上是通过交叉注意力机制实现的。然而,由于现有交叉注意力中的二次复杂度和缺乏显式匹配约束,高分辨率图像的匹配仍然具有挑战性。本文提出了一种注意力机制MatchAttention,它可以动态匹配相对位置。相对位置决定了给定查询时键值对的注意力采样中心。通过所提出的BilinearSoftmax实现了连续且可微的滑动窗口注意力采样。相对位置通过残差连接在层间迭代更新,并嵌入到特征通道中。由于相对位置正是跨视角匹配的学习目标,因此设计了一个以MatchAttention为核心组件的高效分层跨视角解码器MatchDecoder。为了处理跨视角遮挡,提出了门控交叉MatchAttention和一致性约束损失。这两个组件共同减轻了前向和后向传播中遮挡的影响,使模型能够更专注于学习匹配关系。当应用于立体匹配时,MatchStereo-B在公共Middlebury基准测试中平均误差排名第一,并且KITTI分辨率推理仅需29毫秒。MatchStereo-T可以在0.1秒内处理4K超高清图像,仅使用3GB GPU内存。所提出的模型在KITTI 2012、KITTI 2015、ETH3D和Spring flow数据集上也达到了最先进的性能。高精度和低计算复杂度的结合使得实时、高分辨率和高精度的跨视角匹配成为可能。项目页面:https://github.com/TingmanYan/MatchAttention。

关键词

引用

@article{arxiv.2510.14260,
  title  = {MatchAttention: Matching the Relative Positions for High-Resolution Cross-View Matching},
  author = {Tingman Yan and Tao Liu and Xilian Yang and Qunfei Zhao and Zeyang Xia},
  journal= {arXiv preprint arXiv:2510.14260},
  year   = {2025}
}