中文

视觉模型中的独立自注意力

计算机视觉与模式识别 2019-06-17 v1

摘要

卷积是现代计算机视觉系统的基本构建块。最近的方法主张超越卷积以捕捉长程依赖关系。这些工作侧重于用基于内容的交互(如自注意力和非局部均值)来增强卷积模型,以在多项视觉任务上获得性能提升。由此产生的一个自然问题是:注意力能否作为视觉模型的独立基元,而不仅仅是作为卷积之上的增强?在开发和测试纯自注意力视觉模型的过程中,我们验证了自注意力确实可以成为有效的独立层。将 ResNet 模型中所有空间卷积实例替换为一种自注意力形式的简单过程,产生了一个完全基于自注意力的模型,该模型在 ImageNet 分类上优于基线,且 FLOPS 减少了 12%,参数减少了 29%。在 COCO 目标检测上,纯自注意力模型在 FLOPS 减少 39% 和参数减少 34% 的情况下,达到了基线 RetinaNet 的 mAP。详细的消融研究表明,自注意力在后面的层中使用时影响尤为显著。这些结果确立了独立自注意力是视觉从业者工具箱的重要补充。

关键词

引用

@article{arxiv.1906.05909,
  title  = {Stand-Alone Self-Attention in Vision Models},
  author = {Prajit Ramachandran and Niki Parmar and Ashish Vaswani and Irwan Bello and Anselm Levskaya and Jonathon Shlens},
  journal= {arXiv preprint arXiv:1906.05909},
  year   = {2019}
}