论自注意力与卷积的融合
计算机视觉与模式识别
2022-03-15 v2
摘要
卷积与自注意力是两种用于表示学习的强大技术,通常被视为彼此迥异的两种对等方法。在本文中,我们表明二者之间存在紧密的底层关联,即这两种范式的大部分计算实际上是通过同一操作完成的。具体而言,我们首先展示核大小为 k×k 的传统卷积可分解为 个独立的 1×1 卷积,随后进行位移与求和操作。接着,我们将自注意力模块中查询、键和值的投影解释为多个 1×1 卷积,随后计算注意力权重并聚合值。因此,两个模块的第一阶段都包含相似的操作。更重要的是,与第二阶段相比,第一阶段贡献了主导的计算复杂度(通道大小的平方)。这一观察自然引出了一种优雅地融合这两种看似不同范式的方法,即一种兼具自注意力与卷积(ACmix)两者优势的混合型模型,同时与纯卷积或纯自注意力对应模型相比具有最小的计算开销。大量实验表明,在图像识别及下游任务上,我们的模型相较具有竞争力的基线取得了持续改进的結果。代码与预训练模型将发布于 https://github.com/LeapLabTHU/ACmix 与 https://gitee.com/mindspore/models。
引用
@article{arxiv.2111.14556,
title = {On the Integration of Self-Attention and Convolution},
author = {Xuran Pan and Chunjiang Ge and Rui Lu and Shiji Song and Guanfu Chen and Zeyi Huang and Gao Huang},
journal= {arXiv preprint arXiv:2111.14556},
year = {2022}
}
备注
Accepted to CVPR2022