中文

重访 ResNet:改进的训练与缩放策略

计算机视觉与模式识别 2021-03-16 v1

摘要

新颖的计算机视觉架构垄断了聚光灯,但模型架构的影响常与训练方法和缩放策略的同时改变相混淆。我们的工作重访经典 ResNet(He 等人,2015)并研究这三个方面以努力将它们解耦。或许令人惊讶的是,我们发现训练和缩放策略可能比架构改变更重要,并且进一步的,由此得到的 ResNet 可与近期最先进(SOTA)模型匹敌。我们表明最佳缩放策略取决于训练机制,并给出两种新缩放策略:(1)在可能发生过拟合的机制中缩放模型深度(否则宽度缩放更可取);(2)比先前建议(Tan & Le,2019)更慢地提高图像分辨率。利用改进的训练和缩放策略,我们设计了一系列 ResNet 架构,ResNet-RS,其在 TPU 上比 EfficientNet 快 1.7x - 2.7x,同时在 ImageNet 上取得相似准确率。在大规模半监督学习设置中,ResNet-RS 取得 86.2% 的 ImageNet top-1 准确率,同时比 EfficientNet NoisyStudent 快 4.7x。训练技术提升了一组下游任务的迁移性能(媲美最先进的自监督算法)并扩展到 Kinetics-400 上的视频分类。我们建议实践者使用这些简单的修订版 ResNet 作为未来研究的基线。

关键词

引用

@article{arxiv.2103.07579,
  title  = {Revisiting ResNets: Improved Training and Scaling Strategies},
  author = {Irwan Bello and William Fedus and Xianzhi Du and Ekin D. Cubuk and Aravind Srinivas and Tsung-Yi Lin and Jonathon Shlens and Barret Zoph},
  journal= {arXiv preprint arXiv:2103.07579},
  year   = {2021}
}