Armour:面向视觉Transformer的通用紧凑自注意力机制
计算机视觉与模式识别
2021-08-05 v1
摘要
基于注意力的Transformer网络随着其应用从自然语言处理扩展到视觉领域,已展现出巨大潜力。然而,尽管近期取得了诸如次二次方注意力近似和各种训练增强等改进,迄今为止使用常规注意力的紧凑视觉Transformer在准确率、模型大小和吞吐量方面,仍不及对应的卷积网络。本文引入了一种基础且高度通用的紧凑自注意力机制。所提出的方法在现有注意力优化的基础上减少了冗余并提高了效率。我们展示了它对视觉Transformer中常规注意力机制以及一些最新变体的即插即用适用性。最终,我们得到了更小、更快且具有相同或更高准确率的模型。
引用
@article{arxiv.2108.01778,
title = {Armour: Generalizable Compact Self-Attention for Vision Transformers},
author = {Lingchuan Meng},
journal= {arXiv preprint arXiv:2108.01778},
year = {2021}
}