中文

更好的ImageNet-1k纯ViT基线

计算机视觉与模式识别 2022-05-04 v1

摘要

人们普遍认为Vision Transformer模型需要复杂的正则化技术才能在ImageNet-1k规模数据上表现出色。令人惊讶的是,我们发现事实并非如此,标准数据增强已足够。本说明对原始Vision Transformer(ViT)的普通训练设置提出了一些微小修改,显著提升了纯ViT模型的性能。值得注意的是,在TPUv3-8上训练90个epoch可在七小时内超过76%的top-1准确率,与经典ResNet50基线相当,而训练300个epoch可在不到一天内达到80%。

关键词

引用

@article{arxiv.2205.01580,
  title  = {Better plain ViT baselines for ImageNet-1k},
  author = {Lucas Beyer and Xiaohua Zhai and Alexander Kolesnikov},
  journal= {arXiv preprint arXiv:2205.01580},
  year   = {2022}
}

备注

Code available at https://github.com/google-research/big_vision