DALG:用于图像检索的深度注意力局部与全局建模
计算机视觉与模式识别
2022-07-04 v1
摘要
深度学习的表示在以检索再重排的方式中取得了优越的图像检索性能。近期最先进的单阶段模型启发式融合局部与全局特征,在效率与效果间取得了良好权衡。然而,我们注意到现有方案的效率仍受限于其多尺度推理范式。本文遵循单阶段思路,通过成功摆脱多尺度测试,进一步获得复杂度与效果的平衡。为实现该目标,我们弃用广泛使用的卷积网络——因其探索多样视觉模式存在局限,并受 Transformer 成功的启发转而采用完全基于注意力的框架进行鲁棒表示学习。除将 Transformer 用于全局特征提取外,我们设计了一个由基于窗口的多头注意力与空间注意力组成的局部分支,以充分挖掘局部图像模式。此外,我们提出通过交叉注意力模块组合分层局部与全局特征,而非像先前工作那样启发式融合。借助我们的深度注意力局部与全局建模框架(DALG),大量实验结果表明,在保持与最先进方法竞争力相当结果的同时,效率可得以提升。
引用
@article{arxiv.2207.00287,
title = {DALG: Deep Attentive Local and Global Modeling for Image Retrieval},
author = {Yuxin Song and Ruolin Zhu and Min Yang and Dongliang He},
journal= {arXiv preprint arXiv:2207.00287},
year = {2022}
}
备注
8 pages, 6 figures