ConvNets在规模上匹敌视觉Transformer
计算机视觉与模式识别
2023-10-26 v1 机器学习
神经与进化计算
摘要
许多研究者认为ConvNets在小型或中等规模数据集上表现良好,但在使用网络规模数据集时无法与视觉Transformer竞争。我们通过评估在JFT-4B(一个常用于训练基础模型的大型标注图像数据集)上预训练的高性能ConvNet架构来挑战这一看法。我们考虑介于0.4k至110k TPU-v4核心计算小时的预训练计算预算,并从NFNet模型族中训练一系列深度和宽度递增的网络。我们观察到留出损失与计算预算之间的双对数缩放律。在ImageNet上微调后,NFNets匹配了具有可比计算预算的视觉Transformer的报道性能。我们最强的微调模型实现了90.4%的Top-1准确率。
引用
@article{arxiv.2310.16764,
title = {ConvNets Match Vision Transformers at Scale},
author = {Samuel L. Smith and Andrew Brock and Leonard Berrada and Soham De},
journal= {arXiv preprint arXiv:2310.16764},
year = {2023}
}