中文

迈向更深理解:从卷积视角看 RetNet

计算机视觉与模式识别 2023-10-31 v2

摘要

Vision Transformer (ViT) 在广泛图像识别任务上的成功已被大量报道。ViT 可学习优于 CNN 的全局依赖,而 CNN 固有的局部性可替代昂贵的训练资源。近来,RetNet 在语言建模领域的出色表现引起关注,其以显式局部建模超越 Transformer,将研究者的目光转向 CV 领域的 Transformer。本文从 CNN 视角考察 RetNet 的有效性,并提出一种适配视觉领域的 RetNet 变体。类似于 RetNet,我们通过对原始自注意力矩阵施加权重掩码来改进 ViT 的局部建模。实现自注意力矩阵局部自适应的直接方式可通过逐元素可学习权重掩码(ELM)完成,我们的初步结果显示其有前景。然而,逐元素简单可学习权重掩码不仅带来不小的额外参数开销,还增加优化复杂度。为此,本文提出一种新颖的高斯混合掩码(GMM),其中一个掩码仅有两个可学习参数,且可便捷用于任何注意力机制允许使用掩码的 ViT 变体。多个小数据集上的实验结果表明,我们所提高斯掩码可近乎零额外参数或计算代价地提升 ViT。我们的代码公开于 https://github.com/CatworldLee/Gaussian-Mixture-Mask-Attention。

关键词

引用

@article{arxiv.2309.05375,
  title  = {Toward a Deeper Understanding: RetNet Viewed through Convolution},
  author = {Chenghao Li and Chaoning Zhang},
  journal= {arXiv preprint arXiv:2309.05375},
  year   = {2023}
}