中文

浅层视觉变换器的理论理解:学习、泛化与样本复杂度

机器学习 2023-11-15 v3 计算机视觉与模式识别 机器学习

摘要

具有自注意力模块的视觉变换器(ViTs)近期在许多视觉任务中取得了巨大的经验性成功。然而,由于跨层非凸交互,理论上的学习与泛化分析大多难以捉摸。基于刻画标签相关与标签无关_token_的数据模型,本文首次提供了对一个浅层 ViT(即一个自注意力层后接一个两层感知机)进行分类任务训练的理论分析。我们刻画了实现零泛化误差所需的样本复杂度。我们的样本复杂度界与标签相关 token 的比例的倒数、token 噪声水平以及初始模型误差正相关。我们还证明了使用随机梯度下降(SGD)的训练过程会导致稀疏注意力图,这是对关于注意力成功的一般直觉的正式验证。此外,本文指出适当的 token 稀疏化可通过移除标签无关和/或含噪 token(包括虚假关联)来改善测试性能。在合成数据与 CIFAR-10 数据集上的经验实验证实了我们的理论结果,并推广到更深的 ViT。

关键词

引用

@article{arxiv.2302.06015,
  title  = {A Theoretical Understanding of Shallow Vision Transformers: Learning, Generalization, and Sample Complexity},
  author = {Hongkang Li and Meng Wang and Sijia Liu and Pin-yu Chen},
  journal= {arXiv preprint arXiv:2302.06015},
  year   = {2023}
}