X-volution:卷积与自注意力的统一
计算机视觉与模式识别
2021-06-08 v2
摘要
卷积与自注意力作为深度神经网络的两个基本构建模块,前者以线性方式提取局部图像特征,而后者非局部地编码高阶上下文关系。尽管二者本质上互补(即一阶/高阶),最先进的架构(即 CNN 或 transformer)由于缺乏原则性方式在单一计算模块中同时应用两种操作,因其异构计算模式及视觉任务中全局点积过重负担。本工作中,我们从理论推导一种全局自注意力近似方案,通过变换特征上的卷积操作近似自注意力。基于该近似方案,我们建立由卷积与自注意力操作组成的多分支基础模块,能够统一局部与非局部特征交互。重要的是,一旦训练完成,该多分支模块可通过结构重参数化有条件转换为单一标准卷积操作,形成名为 X-volution 的纯卷积风格算子,可作为原子操作插入任何现代网络。大量实验表明,所提 X-volution 取得极具竞争力的视觉理解提升(ImageNet 分类 top-1 准确率 +1.2%,COCO 检测与分割 box AP +1.7、mask AP +1.5)。
引用
@article{arxiv.2106.02253,
title = {X-volution: On the unification of convolution and self-attention},
author = {Xuanhong Chen and Hang Wang and Bingbing Ni},
journal= {arXiv preprint arXiv:2106.02253},
year = {2021}
}