MaiT:利用注意力掩码实现更高效的图像Transformer
计算机视觉与模式识别
2022-07-08 v1
摘要
尽管图像Transformer在计算机视觉任务中已展现出与卷积神经网络相竞争的结果,但缺乏诸如局部性之类的归纳偏置,在模型效率方面仍然构成问题,尤其对于嵌入式应用而言。在这项工作中,我们通过引入注意力掩码,将空间局部性融入自注意力头,来解决此问题。局部依赖关系通过带掩码的注意力头高效捕获,而全局依赖关系则由不带掩码的注意力头捕获。借助带掩码注意力机制的图像Transformer——MaiT,与CaiT相比,在更少的参数量和FLOPs下,Top-1准确率最高提升了1.7%;与Swin相比,吞吐量最高提升了1.5倍。利用注意力掩码编码局部性是与模型无关的,因此适用于单体、分层或其他新型Transformer架构。
引用
@article{arxiv.2207.03006,
title = {MaiT: Leverage Attention Masks for More Efficient Image Transformers},
author = {Ling Li and Ali Shafiee Ardestani and Joseph Hassoun},
journal= {arXiv preprint arXiv:2207.03006},
year = {2022}
}