用于高效局部注意力的可学习查询
计算机视觉与模式识别
2022-04-20 v2
摘要
Vision Transformers (ViT) 是强大的视觉模型。与过去几年主导视觉研究的卷积神经网络不同,视觉变换器能够捕捉数据中的长程依赖关系。然而,任何变换器架构的组成部分——自注意力机制——都存在高延迟和内存利用效率低下的问题,使其不太适合高分辨率输入图像。为缓解这些缺陷,分层视觉模型在非交错窗口上局部采用自注意力。这种松弛将复杂度降低至关于输入大小的线性;但限制了跨窗口交互,损害了模型性能。本文提出一种新的平移不变局部注意力层,称为 query and attend (QnA),以类似卷积的重叠方式在局部聚合输入。QnA 的核心思想是引入可学习查询,从而实现快速高效的实现。我们通过将 QnA 层整合进一个分层视觉变换器模型来验证其有效性。我们展示了在速度和内存复杂度上的改进,同时达到了与最先进(state-of-the-art, SOTA)模型相当的精度。最后,我们的层在窗口大小上尤其具有良好的扩展性,与现有方法相比所需内存最多减少 10 倍,速度最多快 5 倍。代码公开于 \url{https://github.com/moabarar/qna}。
引用
@article{arxiv.2112.11435,
title = {Learned Queries for Efficient Local Attention},
author = {Moab Arar and Ariel Shamir and Amit H. Bermano},
journal= {arXiv preprint arXiv:2112.11435},
year = {2022}
}
备注
CVPR 2022 - Oral