基于小波神经算子的视觉 Transformer 多尺度注意力
计算机视觉与模式识别
2023-08-16 v4 机器学习
摘要
Transformer 已在计算机视觉中取得广泛成功。其核心是自注意力(SA)机制,一种通过加权基将输入中每个令牌与所有其他令牌关联的归纳偏置。标准 SA 机制随序列长度呈二次复杂度,阻碍了其在高分辨率视觉中长序列上的应用。近来,受偏微分方程算子学习启发,自适应傅里叶神经算子(AFNO)被引入用于基于全局卷积的高分辨率注意力,该卷积通过 FFT 高效实现。然而,AFNO 的全局滤波不能很好地表示自然图像中常见的小尺度与中等尺度结构。为利用由粗到细的尺度结构,我们引入多尺度小波注意力(MWA),利用小波神经算子,其随序列大小呈线性复杂度。我们用 MWA 替换 ViT 中的注意力,在 CIFAR 与 Tiny-ImageNet 分类上的实验表明其相较其他基于傅里叶的注意力(如 AFNO 与全局滤波网络(GFN))有显著提升。
引用
@article{arxiv.2303.12398,
title = {Multiscale Attention via Wavelet Neural Operators for Vision Transformers},
author = {Anahita Nekoozadeh and Mohammad Reza Ahmadzadeh and Zahra Mardani},
journal= {arXiv preprint arXiv:2303.12398},
year = {2023}
}