ParCNetV2:具有增强注意力的超大核卷积网络
计算机视觉与模式识别
2023-03-17 v3
摘要
Transformer 在各种计算机视觉任务中展现出巨大潜力。通过借鉴 Transformer 的设计理念,许多研究革新了 CNN 并取得了显著成果。本文属于这一类研究。具体而言,我们提出一种新的卷积神经网络 ParCNetV2,它扩展了位置感知循环卷积 (ParCNet),引入超大卷积与分叉门单元以增强注意力。超大卷积采用大小为输入两倍的核,通过全局感受野建模长程依赖。同时,它通过从卷积核中移除平移不变性来实现隐式位置编码,即当核大小为输入大小的两倍时,不同空间位置处的有效核是不同的。分叉门单元实现了类似于 Transformer 中自注意力的注意力机制。它通过两个分支的逐元素相乘来应用,其中一个分支用作特征变换,另一个分支用作注意力权重。此外,我们引入统一的局部-全局卷积块,以统一早期和后期卷积块的设计。大量实验证明了我们的方法相对于其他卷积神经网络以及结合 CNN 与 Transformer 的混合模型的优越性。代码将会公开。
引用
@article{arxiv.2211.07157,
title = {ParCNetV2: Oversized Kernel with Enhanced Attention},
author = {Ruihan Xu and Haokui Zhang and Wenze Hu and Shiliang Zhang and Xiaoyu Wang},
journal= {arXiv preprint arXiv:2211.07157},
year = {2023}
}
备注
16 pages, 10 figures. Source code is available at https://github.com/XuRuihan/ParCNetV2