大规模自回归图像模型的可扩展预训练
计算机视觉与模式识别
2024-01-17 v1
摘要
本文介绍了 AIM,一组采用自回归目标进行预训练的视觉模型集合。这些模型受其文本对应物——即大语言模型(LLMs)——的启发,并展现出相似的缩放特性。具体而言,我们强调了两项关键发现:(1) 视觉特征的性能随模型容量和数据量而缩放,(2) 目标函数的值与模型在下游任务上的性能相关。我们通过在一个包含 20 亿张图像的数据集上预训练一个具有 70 亿参数的 AIM 模型,展示了这些发现的实际意义,该模型在冻结主干网络的情况下,于 ImageNet-1k 上达到了 84.0% 的准确率。有趣的是,即使在这种规模下,我们也没有观察到性能饱和的迹象,这表明 AIM 可能代表大规模视觉模型训练的新前沿。AIM 的预训练类似于 LLMs 的预训练,并且不需要任何特定于图像的策略来稳定大规模训练。
引用
@article{arxiv.2401.08541,
title = {Scalable Pre-training of Large Autoregressive Image Models},
author = {Alaaeldin El-Nouby and Michal Klein and Shuangfei Zhai and Miguel Angel Bautista and Alexander Toshev and Vaishaal Shankar and Joshua M Susskind and Armand Joulin},
journal= {arXiv preprint arXiv:2401.08541},
year = {2024}
}
备注
https://github.com/apple/ml-aim