视觉 Transformer 中注意力机制的结构化初始化
计算机视觉与模式识别
2024-04-02 v1
摘要
在小规模数据集上训练视觉 Transformer (ViT) 网络是一项重大挑战。相比之下,卷积神经网络 (CNN) 具有架构归纳偏置,使其在此类问题上表现优异。在本文中,我们论证了 CNN 固有的架构偏置可以重新解释为 ViT 内部的初始化偏置。这一见解意义重大,它使 ViT 能够在小规模问题上表现同样出色,同时保持其在大规模应用中的灵活性。我们对这种“结构化”初始化的启发源于一项经验观察:在 CNN 中,随机脉冲滤波器可以达到与学习到的滤波器相当的性能。我们的方法在包括 CIFAR-10、CIFAR-100 和 SVHN 在内的众多基准测试中,实现了数据高效的 ViT 学习的最先进性能。
引用
@article{arxiv.2404.01139,
title = {Structured Initialization for Attention in Vision Transformers},
author = {Jianqiao Zheng and Xueqian Li and Simon Lucey},
journal= {arXiv preprint arXiv:2404.01139},
year = {2024}
}
备注
20 pages, 5 figures, 8 tables