中文

MAE 预预训练在十亿规模预训练中的有效性

计算机视觉与模式识别 2024-01-26 v3 人工智能 机器学习

摘要

本文重新审视计算机视觉中用于视觉识别任务的标准“预训练—再微调”范式。通常,最先进的基模型利用数十亿图像的大规模(弱)监督数据集进行预训练。我们引入了一个简单且使用自监督 MAE 技术的额外预预训练阶段来初始化模型。尽管 MAE 此前仅被证明随模型规模扩展,我们发现它也随训练数据集规模扩展。因此,我们基于 MAE 的预预训练随模型与数据规模同时扩展,使其适用于训练基模型。预预训练在一系列模型规模(数百万至数十亿参数)和数据集规模(数百万至数十亿图像)上持续改善模型收敛性与下游迁移性能。我们在涵盖图像分类、视频识别、目标检测、少样本分类和零样本识别的 10 个不同视觉识别任务上度量了预预训练的有效性。我们最大的模型在 iNaturalist-18 (91.7%)、ImageNet-ReaL (91.1%)、1-shot ImageNet-1k (63.6%) 以及 Food-101 上的零样本迁移 (96.2%) 取得了新的最先进结果。我们的研究揭示,即便对于数十亿图像的网页规模预训练,模型初始化也起着重要作用,且我们的模型已公开可用。

关键词

引用

@article{arxiv.2303.13496,
  title  = {The effectiveness of MAE pre-pretraining for billion-scale pretraining},
  author = {Mannat Singh and Quentin Duval and Kalyan Vasudev Alwala and Haoqi Fan and Vaibhav Aggarwal and Aaron Adcock and Armand Joulin and Piotr Dollár and Christoph Feichtenhofer and Ross Girshick and Rohit Girdhar and Ishan Misra},
  journal= {arXiv preprint arXiv:2303.13496},
  year   = {2024}
}

备注

ICCV 2023. Models available at https://github.com/facebookresearch/maws/