让 ViT 成型:面向计算最优模型设计的缩放定律
计算机视觉与模式识别
2024-01-10 v5 机器学习
摘要
缩放定律近来被用于推导给定计算时长下计算最优的模型规模(参数数量)。我们推进并改进了此类方法,以推断计算最优的模型形状(如宽度和深度),并成功将其应用于视觉 Transformer。我们形状优化的视觉 Transformer(SoViT)在预训练计算量相当的情况下,取得了与规模超过其两倍的模型相竞争的结果。例如,SoViT-400m/14 在 ILSRCV2012 上达到了 90.3% 的微调准确率,在相同设置下超越了更大的 ViT-g/14 并接近 ViT-G/14,且推理成本还不到后者的一半。我们在图像分类、图像描述、VQA 和零样本迁移等多项任务上进行了全面评估,证明了我们的模型在广泛领域中的有效性,并指出了其局限性。总体而言,我们的发现挑战了盲目扩大视觉模型规模的流行做法,并为更明智的缩放指明了路径。
引用
@article{arxiv.2305.13035,
title = {Getting ViT in Shape: Scaling Laws for Compute-Optimal Model Design},
author = {Ibrahim Alabdulmohsin and Xiaohua Zhai and Alexander Kolesnikov and Lucas Beyer},
journal= {arXiv preprint arXiv:2305.13035},
year = {2024}
}
备注
10 pages, 7 figures, 9 tables. Version 2: Layout fixes