基于注意力的多模态图像匹配
计算机视觉与模式识别
2023-09-26 v2 机器学习
摘要
我们提出一种基于注意力的方法,用于多模态图像块匹配,该方法使用Transformer编码器关注多尺度孪生CNN的特征图。我们的编码器被证明能高效聚合多尺度图像嵌入,同时强调任务特定的外观不变图像线索。我们还引入了注意力残差架构,使用绕过编码器的残差连接。这一额外的学习信号有助于从零开始进行端到端训练。实验表明,我们的方法在多模态和单模态基准上都达到了新的SOTA精度,说明了其普遍适用性。据我们所知,这是Transformer编码器架构在多模态图像块匹配任务上的首次成功实现。
引用
@article{arxiv.2103.11247,
title = {Attention-Based Multimodal Image Matching},
author = {Aviad Moreshet and Yosi Keller},
journal= {arXiv preprint arXiv:2103.11247},
year = {2023}
}