通过掩码缩放语言-图像预训练
计算机视觉与模式识别
2023-03-31 v2
摘要
我们提出快速语言-图像预训练(FLIP),一种训练CLIP的简单且更高效的方法。我们的方法在训练期间随机掩码掉并移除大部分图像块。掩码使我们能在相同挂钟时间内从更多图像-文本对中学习,并以相似内存占用在每次迭代中对比更多样本。它在精度与训练时间之间带来了有利的权衡。在我们基于4亿图像-文本对的实验中,FLIP相较无掩码基线同时提升了精度与速度。在大量不同的下游任务上,FLIP显著优于在相同数据上训练的CLIP对应模型。受加速的推动,我们探索了增大模型规模、数据规模或训练时长的缩放行为,并报告了令人鼓舞的结果与比较。我们希望我们的工作能促成未来关于缩放视觉-语言学习的研究。
引用
@article{arxiv.2212.00794,
title = {Scaling Language-Image Pre-training via Masking},
author = {Yanghao Li and Haoqi Fan and Ronghang Hu and Christoph Feichtenhofer and Kaiming He},
journal= {arXiv preprint arXiv:2212.00794},
year = {2023}
}
备注
Tech report; arXiv v2: update scaling results and add code repo