中文

视觉Transformer在无预训练或强数据增强下超越ResNet

计算机视觉与模式识别 2022-03-15 v3 机器学习

摘要

Vision Transformers (ViTs) 与多层感知机(MLPs)标志着以通用神经网络架构替代手工设计特征或归纳偏置的进一步努力。现有工作通过海量数据(如大规模预训练及/或反复强数据增强)来增强模型,但仍报告与优化相关的问题(例如对初始化和学习率的敏感性)。因此,本文从损失几何的视角研究 ViTs 与 MLP-Mixers,旨在提升模型训练时的数据效率与推理时的泛化能力。可视化与 Hessian 矩阵揭示收敛模型存在极尖锐的局部极小值。通过采用近期提出的锐度感知优化器促进平滑性,我们在监督、对抗、对比与迁移学习等多项任务上大幅提升了 ViTs 与 MLP-Mixers 的准确率与鲁棒性(例如,在采用简单 Inception 风格预处理时,ViT-B/16 与 Mixer-B/16 在 ImageNet 上的 top-1 准确率分别提升 +5.3% 与 +11.0%)。我们表明,平滑性的改善归因于前几层中更稀疏的活跃神经元。由此得到的 ViTs 在 ImageNet 上从头训练、无需大规模预训练或强数据增强时,优于规模与吞吐量相近的 ResNets。模型检查点见 \url{https://github.com/google-research/vision_transformer}。

关键词

引用

@article{arxiv.2106.01548,
  title  = {When Vision Transformers Outperform ResNets without Pre-training or Strong Data Augmentations},
  author = {Xiangning Chen and Cho-Jui Hsieh and Boqing Gong},
  journal= {arXiv preprint arXiv:2106.01548},
  year   = {2022}
}

备注

ICLR 2022 (spotlight)