MatchFormer:在Transformer中交错注意力以进行特征匹配
计算机视觉与模式识别
2022-09-27 v3 机器人学
图像与视频处理
摘要
局部特征匹配是一项亚像素级别计算密集的任务。基于检测器并结合特征描述子的方法在低纹理场景中表现不佳,而采用顺序提取再匹配流程的基于CNN的方法,未能利用编码器的匹配能力,且往往使解码器在匹配上负担过重。相反,我们提出一种新颖的分层提取并匹配Transformer,称为MatchFormer。在分层编码器的每个阶段中,我们交错使用自注意力进行特征提取和交叉注意力进行特征匹配,产生一种符合人类直觉的提取并匹配方案。这种匹配感知的编码器释放了过载的解码器,使模型高效。此外,在分层架构中对多尺度特征结合自注意力与交叉注意力,提升了匹配的鲁棒性,尤其在低纹理室内场景或室外训练数据较少时。得益于该策略,MatchFormer在效率、鲁棒性和精度上均为多赢方案。相较于此前室内姿态估计的最佳方法,我们的轻量MatchFormer仅用45%的GFLOPs,却实现了+1.3%的精度提升和41%的运行速度增益。大型MatchFormer在四个不同基准上达到最先进水平,包括室内姿态估计(ScanNet)、室外姿态估计(MegaDepth)、单应性估计与图像匹配(HPatch)以及视觉定位(InLoc)。
引用
@article{arxiv.2203.09645,
title = {MatchFormer: Interleaving Attention in Transformers for Feature Matching},
author = {Qing Wang and Jiaming Zhang and Kailun Yang and Kunyu Peng and Rainer Stiefelhagen},
journal= {arXiv preprint arXiv:2203.09645},
year = {2022}
}
备注
Accepted to ACCV 2022. Code is available at https://github.com/jamycheung/MatchFormer