SwiftFormer:面向基于Transformer的实时移动视觉应用的高效加性注意力
计算机视觉与模式识别
2023-07-27 v2
摘要
自注意力已成为各种视觉任务中获取全局上下文的事实标准选择。然而,其相对于图像分辨率的二次计算复杂度限制了它在实时应用中的使用,尤其是在资源受限的移动设备上的部署。尽管已有混合方法被提出以结合卷积与自注意力的优势来获得更好的速度-精度权衡,但自注意力中昂贵的矩阵乘法操作仍是瓶颈。本工作中,我们提出一种新颖的高效加性注意力机制,用线性逐元素乘法有效替代了二次矩阵乘法操作。我们的设计表明,键值交互可被线性层替代而不损失任何精度。与以往最先进方法不同,我们对自注意力的高效表述使其能在网络的所有阶段使用。利用我们提出的高效加性注意力,我们构建了一系列称为“SwiftFormer”的模型,在精度和移动端推理速度上均达到最先进性能。我们的小变体在iPhone 14上仅以0.8 ms延迟取得78.5%的ImageNet-1K top-1精度,比MobileViT-v2更精确且快2倍。代码:https://github.com/Amshaker/SwiftFormer
引用
@article{arxiv.2303.15446,
title = {SwiftFormer: Efficient Additive Attention for Transformer-based Real-time Mobile Vision Applications},
author = {Abdelrahman Shaker and Muhammad Maaz and Hanoona Rasheed and Salman Khan and Ming-Hsuan Yang and Fahad Shahbaz Khan},
journal= {arXiv preprint arXiv:2303.15446},
year = {2023}
}
备注
Accepted at ICCV 2023