中文

GMTR:图匹配变换器

计算机视觉与模式识别 2023-12-15 v2 机器学习

摘要

视觉变换器(ViTs)近来已被用于目标检测与分割之外的视觉匹配。然而,ViTs原有的网格划分策略忽略了关键点的空间信息,限制了对局部信息的敏感性。因此,我们提出QueryTrans(查询变换器),其采用交叉注意力模块与基于关键点的中心裁剪策略以更好地提取空间信息。我们进一步整合图注意力模块,并设计了一种基于变换器的图匹配方法GMTR(图匹配变换器,Graph Matching TRansformers),其中图匹配的组合性质由一个图变换器神经图匹配求解器处理。在标准图匹配基准上,GMTR展现出与SOTA框架相竞争的性能。具体而言,在Pascal VOC上,GMTR达到83.6%\mathbf{83.6\%}准确率,比SOTA框架高0.9%\mathbf{0.9\%}。在Spair-71k上,GMTR展现出巨大潜力并优于以往多数工作。同时,在Pascal VOC上,QueryTrans将NGMv2的准确率从80.1%80.1\%提升至83.3%\mathbf{83.3\%},将BBGM从79.0%79.0\%提升至84.5%\mathbf{84.5\%}。在Spair-71k上,QueryTrans将NGMv2从80.6%80.6\%提升至82.5%\mathbf{82.5\%},将BBGM从82.1%82.1\%提升至83.9%\mathbf{83.9\%}。源代码将公开可用。

关键词

引用

@article{arxiv.2311.08141,
  title  = {GMTR: Graph Matching Transformers},
  author = {Jinpei Guo and Shaofeng Zhang and Runzhong Wang and Chang Liu and Junchi Yan},
  journal= {arXiv preprint arXiv:2311.08141},
  year   = {2023}
}