FMRT:基于调和 Transformer 学习精确特征匹配
计算机视觉与模式识别
2023-10-23 v1
摘要
局部特征匹配作为若干计算机视觉任务(如运动恢复结构与视觉定位)的基本组件,已被基于 Transformer 的方法有效解决。然而,这些方法仅在固定感受野下于关键点间整合长程上下文信息,这限制了网络调和不同感受野特征重要性以实现完整图像感知的能力,进而限制了匹配精度。此外,这些方法利用常规手工编码方式将关键点位置信息整合进视觉描述子,限制了网络提取可靠位置编码信息的能力。本研究中,我们提出基于调和 Transformer 的特征匹配(FMRT),一种新颖的基于 Transformer 的无检测器方法,其自适应调和具多感受野的不同特征,并利用并行网络实现可靠位置编码。具体而言,FMRT 提出专用的调和 Transformer(RecFormer),其由全局感知注意力层(GPAL)提取不同感受野的视觉描述子并在多尺度下整合全局上下文信息、感知权重层(PWL)自适应度量各感受野重要性,以及局部感知前馈网络(LPFFN)提取深度聚合的多尺度局部特征表征。大量实验表明,FMRT 在包括姿态估计、视觉定位、单应性估计与图像匹配在内的多个基准上取得优异性能。
引用
@article{arxiv.2310.13605,
title = {FMRT: Learning Accurate Feature Matching with Reconciliatory Transformer},
author = {Xinyu Zhang and Li Wang and Zhiqiang Jiang and Kun Dai and Tao Xie and Lei Yang and Wenhao Yu and Yang Shen and Jun Li},
journal= {arXiv preprint arXiv:2310.13605},
year = {2023}
}