中文

CATs:用于视觉对应的代价聚合 Transformer

计算机视觉与模式识别 2021-12-16 v4

摘要

我们提出一种新颖的代价聚合网络,称为代价聚合 Transformer(CATs),用于在语义相似图像间寻找稠密对应,并处理由大类内表观与几何变化带来的额外挑战。代价聚合是匹配任务中极为重要的过程,匹配精度取决于其输出质量。相较于手工设计或基于 CNN 的代价聚合方法——前者缺乏对严重形变的鲁棒性,后者继承了 CNN 因有限感受野而无法区分错误匹配的局限——CATs 借助若干架构设计充分利用自注意力机制,在初始相关图间探索全局共识。具体而言,我们引入表观亲和力建模以辅助代价聚合过程,从而消歧有噪的初始相关图,并提出多级聚合以从分层特征表示中高效捕获不同语义。我们进而结合交换自注意力技术与残差连接,不仅强化一致匹配,也简化学习过程,我们发现这些带来了明显的性能提升。我们开展实验证明所提模型相较最新方法的有效性,并给出大量消融研究。项目主页:https://sunghwanhong.github.io/CATs/。

关键词

引用

@article{arxiv.2106.02520,
  title  = {CATs: Cost Aggregation Transformers for Visual Correspondence},
  author = {Seokju Cho and Sunghwan Hong and Sangryul Jeon and Yunsung Lee and Kwanghoon Sohn and Seungryong Kim},
  journal= {arXiv preprint arXiv:2106.02520},
  year   = {2021}
}

备注

Code and trained models are available at https://sunghwanhong.github.io/CATs/