CATs++:利用卷积与 Transformer 增强代价聚合
计算机视觉与模式识别
2022-11-01 v2
摘要
代价聚合是图像匹配任务中一个极为重要的过程,旨在消除含噪匹配分数的歧义。现有方法通常通过手工设计或基于 CNN 的方法来解决此问题,它们要么对严重形变缺乏鲁棒性,要么继承了 CNN 因感受野有限且不可自适应而难以区分错误匹配的局限。本文中,我们引入 Cost Aggregation with Transformers (CATs),借助若干架构设计,利用自注意力机制的全局感受野探索初始相关性图中的全局一致性,从而解决该问题。此外,为缓解 CATs 可能面临的一些局限,即标准 transformer 的使用导致计算成本高昂(其复杂度随空间和特征维度大小增长),使其仅能在有限分辨率下应用并导致性能相当受限,我们提出 CATs++,作为 CATs 的扩展。我们提出的方法以大幅优势超越先前最先进方法,在包括 PF-WILLOW、PF-PASCAL 和 SPair-71k 在内的所有基准上确立了新的最先进水平。我们进一步提供了大量的消融研究和分析。
引用
@article{arxiv.2202.06817,
title = {CATs++: Boosting Cost Aggregation with Convolutions and Transformers},
author = {Seokju Cho and Sunghwan Hong and Seungryong Kim},
journal= {arXiv preprint arXiv:2202.06817},
year = {2022}
}
备注
Accepted to TPAMI. Project page:https://ku-cvlab.github.io/CATs-PlusPlus-Project-Page/ arXiv admin note: text overlap with arXiv:2106.02520