中文

视觉 Transformer 中注意力机制的结构化初始化

计算机视觉与模式识别 2024-04-02 v1

摘要

在小规模数据集上训练视觉 Transformer (ViT) 网络是一项重大挑战。相比之下,卷积神经网络 (CNN) 具有架构归纳偏置,使其在此类问题上表现优异。在本文中,我们论证了 CNN 固有的架构偏置可以重新解释为 ViT 内部的初始化偏置。这一见解意义重大,它使 ViT 能够在小规模问题上表现同样出色,同时保持其在大规模应用中的灵活性。我们对这种“结构化”初始化的启发源于一项经验观察:在 CNN 中,随机脉冲滤波器可以达到与学习到的滤波器相当的性能。我们的方法在包括 CIFAR-10、CIFAR-100 和 SVHN 在内的众多基准测试中,实现了数据高效的 ViT 学习的最先进性能。

关键词

引用

@article{arxiv.2404.01139,
  title  = {Structured Initialization for Attention in Vision Transformers},
  author = {Jianqiao Zheng and Xueqian Li and Simon Lucey},
  journal= {arXiv preprint arXiv:2404.01139},
  year   = {2024}
}

备注

20 pages, 5 figures, 8 tables