掩码自编码在大规模自然语言监督中并无助益
计算机视觉与模式识别
2023-05-16 v4 人工智能
摘要
自监督与自然语言监督已成为训练通用图像编码器的两种令人振奋的方式,这类编码器在多种下游任务上表现出色。近期如 M3AE 与 SLIP 等工作表明这些方式可有效结合,但值得注意的是其结果使用小型预训练数据集(<5000万样本),未能有效反映这些方式常用的大规模体制(>1亿样本)。在此我们研究类似方法在更大量数据训练时是否仍有效。我们发现,将两种前沿方法——掩码自编码器 MAE 与对比语言-图像预训练 CLIP——结合,在 1130 万图像-文本对语料上训练时相对 CLIP 有收益,但在 14 亿图像的大规模语料上训练时(通过一组常见视觉任务评测)相对 CLIP 几乎无收益。我们的工作为自监督在大规模图像-文本训练中的有效性(或缺乏有效性)提供了亟需的澄清。
引用
@article{arxiv.2301.07836,
title = {Masked Autoencoding Does Not Help Natural Language Supervision at Scale},
author = {Floris Weers and Vaishaal Shankar and Angelos Katharopoulos and Yinfei Yang and Tom Gunter},
journal= {arXiv preprint arXiv:2301.07836},
year = {2023}
}
备注
Accepted at CVPR 2023