缩放(向下)CLIP:数据、架构与训练策略的综合分析
计算机视觉与模式识别
2024-04-17 v2
摘要
本文研究了对比语言-图像预训练 (CLIP) 在缩减至有限计算预算时的性能。我们从数据、架构和训练策略三个维度探索了 CLIP。在数据方面,我们证明了高质量训练数据的重要性,并表明较小的高质量数据集可以优于质量较低的较大数据集。我们还考察了模型性能如何随不同数据集大小而变化,指出较小的 ViT 模型更适合较小的数据集,而在固定计算量下,较大的模型在较大的数据集上表现更好。此外,我们为在 CLIP 训练中何时选择基于 CNN 的架构或基于 ViT 的架构提供了指导。我们比较了四种 CLIP 训练策略——SLIP、FLIP、CLIP 和 CLIP+Data Augmentation,并表明训练策略的选择取决于可用的计算资源。我们的分析表明,CLIP+Data Augmentation 仅使用一半的训练数据即可达到与 CLIP 相当的性能。这项工作为如何有效地训练和部署 CLIP 模型提供了实用见解,使其在各种应用中更易于普及且成本更低。
关键词
引用
@article{arxiv.2404.08197,
title = {Scaling (Down) CLIP: A Comprehensive Analysis of Data, Architecture, and Training Strategies},
author = {Zichao Li and Cihang Xie and Ekin Dogus Cubuk},
journal= {arXiv preprint arXiv:2404.08197},
year = {2024}
}