面向空间归纳偏置的多维Hyena
计算机视觉与模式识别
2023-09-26 v1 机器学习
摘要
近年来,Vision Transformers引起了计算机视觉研究者越来越多的兴趣。然而,这些transformer相对于CNN的优势只有在大规模数据集上训练时才充分显现,主要由于transformer自注意力机制中对空间局部性的归纳偏置减弱。本文提出一种不依赖自注意力的数据高效视觉transformer,而是采用对最新Hyena层向多个轴的全新推广。我们提出若干获得该推广的替代方案,并从经验与理论角度深入探究其独特区别与考量。经验结果表明,所提Hyena N-D层提升了多种Vision Transformer架构(如ViT、Swin和DeiT)在多个数据集上的性能。此外,在小数据集场景下,我们的基于Hyena的ViT优于近期文献中专为解决相同挑战(即处理小数据集或将图像特定归纳偏置引入自注意力机制)而设计的ViT变体。最后,我们展示一种混合方法:在ViT前几层基于Hyena N-D,其后接含常规注意力的层,可稳定提升多种视觉transformer架构的性能。
引用
@article{arxiv.2309.13600,
title = {Multi-Dimensional Hyena for Spatial Inductive Bias},
author = {Itamar Zimerman and Lior Wolf},
journal= {arXiv preprint arXiv:2309.13600},
year = {2023}
}
备注
10 pages, 3 figures