中文

质量而非数量:论数据集设计与 CLIP 鲁棒性之间的相互作用

机器学习 2023-02-02 v4 计算机视觉与模式识别

摘要

网络爬取的数据集使 CLIP(对比语言-图像预训练)或 Flamingo 等近期图像-文本模型具备了卓越的泛化能力,但关于数据集创建过程的细节却鲜为人知。在本工作中,我们引入了一个由六个公开数据源——YFCC、LAION、Conceptual Captions、WIT、RedCaps、Shutterstock——组成的测试平台,以研究预训练分布如何诱导 CLIP 的鲁棒性。我们发现,预训练数据的性能在不同分布偏移下差异显著,没有任何单一数据源占据主导。此外,我们系统地研究了这些数据源之间的相互作用,发现将多个数据源组合并不一定能产生更好的模型,反而会稀释最佳单个数据源的鲁棒性。我们以一个简单的设定下的理论洞见补充了我们的实证发现,在该设定中,组合训练数据同样导致鲁棒性被稀释。此外,我们的理论模型为近期 LAION 数据集中采用的基于 CLIP 的数据过滤技术的成功提供了一个可能的解释。总体而言,我们的结果表明,简单地从网络上收集大量数据并不是构建用于鲁棒泛化的预训练数据集的最有效方式,亟需对数据集设计进行进一步研究。代码可在 https://github.com/mlfoundations/clip_quality_not_quantity 获取。

关键词

引用

@article{arxiv.2208.05516,
  title  = {Quality Not Quantity: On the Interaction between Dataset Design and Robustness of CLIP},
  author = {Thao Nguyen and Gabriel Ilharco and Mitchell Wortsman and Sewoong Oh and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2208.05516},
  year   = {2023}
}

备注

Oral paper at NeurIPS 2022