中文

参数降低改善视觉Transformer:权共享与宽度降低的比较研究

计算机视觉与模式识别 2025-12-02 v1 人工智能 机器学习

摘要

虽然许多经验结果和规模定律表明增加视觉Transformer的规模通常会提高性能,但模型准确率和训练行为并不总是随规模单调增加。我们关注在ImageNet-1K上训练的ViT-B/16,研究两种简单的参数降低策略,这两种策略各自删除了32.7%的基准参数。我们的 GroupedMLP变体在相邻Transformer块之间共享MLP权重,实现了81.47%的top-1准确率,同时保持基准的计算成本。我们的 ShallowMLP变体将MLP隐藏维度减半,达到81.25%的top-1准确率,并以38%的推理吞吐量提升。两种模型都优于86.6M参数的基准(81.05%),并显著改进了训练稳定性,将峰值到最终准确率下降从0.47%降低至0.03%至0.06%的范围。这些结果表明,对于在ImageNet-1K上采用标准训练配方的ViT-B/16,模型处于过参数化 regime,其中可以在不损害性能甚至略微提升性能的情况下减少MLP容量。更广泛地说,我们的发现表明,诸如参数共享和宽度缩减等架构约束可能作为有用的归纳偏置,以及在设计视觉Transformer时如何分配参数的重要性。所有代码均可在:https://github.com/AnanthaPadmanaban-KrishnaKumar/parameter-efficient-vit-mlps 获取。

关键词

引用

@article{arxiv.2512.01059,
  title  = {Parameter Reduction Improves Vision Transformers: A Comparative Study of Sharing and Width Reduction},
  author = {Anantha Padmanaban Krishna Kumar},
  journal= {arXiv preprint arXiv:2512.01059},
  year   = {2025}
}

备注

7 pages total (6 pages main text, 1 page references), 1 figures, 2 tables. Code available at https://github.com/AnanthaPadmanaban-KrishnaKumar/parameter-efficient-vit-mlps