中文

缩放 ReLU 对训练视觉 Transformer 至关重要

计算机视觉与模式识别 2022-01-13 v2

摘要

视觉 Transformer(ViT)已成为卷积神经网络(CNN)之外的一种替代设计范式。然而,ViT 的训练比 CNN 困难得多,因为它对学习率、优化器和预热轮次等训练参数敏感。文献~\cite{xiao2021early} 对训练困难的原因进行了实证分析,作者推测问题在于 ViT 模型的 \textit{patchify-stem},并提出早期卷积有助于 Transformer 看得更好。本文进一步研究了这一问题,并扩展了上述结论:仅靠早期卷积无助于稳定训练,而 \textit{卷积 stem}(\textit{conv-stem})中的缩放 ReLU 操作才是关键。我们从理论和实验两方面验证了 \textit{conv-stem} 中的缩放 ReLU 不仅能改善训练稳定性,还能增加 patch token 的多样性,从而通过增加少量参数和计算量大幅提升峰值性能。此外,大量实验表明,以往的 ViT 远未得到良好训练,进一步说明 ViT 具有成为 CNN 更优替代方案的巨大潜力。

关键词

引用

@article{arxiv.2109.03810,
  title  = {Scaled ReLU Matters for Training Vision Transformers},
  author = {Pichao Wang and Xue Wang and Hao Luo and Jingkai Zhou and Zhipeng Zhou and Fan Wang and Hao Li and Rong Jin},
  journal= {arXiv preprint arXiv:2109.03810},
  year   = {2022}
}

备注

Accepted by AAAI2022