中文

视觉Transformer中的稀疏双下降:真实还是虚惊一场?

计算机视觉与模式识别 2023-09-13 v1

摘要

视觉Transformer(ViT)在近期理论与实证工作中广受关注。它们凭借基于注意力的方法达到最先进水平,该方法通过避免归纳偏置的能力提升图像中关键特征与模式的识别,从而实现高精度的图像分析。同时,较新的研究报道了现代深度学习模型中可能出现的“稀疏双下降”现象,即极度过参数化模型亦可良好泛化。这引发了关于模型最优规模的实际问题,并开启了寻找稀疏性与性能间最佳权衡的探索:视觉Transformer是否也易受稀疏双下降影响?我们能否找到避免该现象的方法?我们的工作探讨了ViTs上稀疏双下降的出现。尽管某些工作表明传统架构(如Resnet)注定遭遇稀疏双下降现象,但对于ViTs我们观察到最优调参的 2\ell_2 正则化可缓解该现象。然而,一切皆有代价:最优lambda将牺牲ViT潜在的压缩能力。

关键词

引用

@article{arxiv.2307.14253,
  title  = {Sparse Double Descent in Vision Transformers: real or phantom threat?},
  author = {Victor Quétu and Marta Milovanovic and Enzo Tartaglione},
  journal= {arXiv preprint arXiv:2307.14253},
  year   = {2023}
}