中文

揭开CLIP数据的神秘面纱

计算机视觉与模式识别 2025-11-25 v6 计算与语言

摘要

对比语言-图像预训练(CLIP)是一种推动了计算机视觉研究与应用进展的方法,催生了现代识别系统与生成模型。我们认为CLIP成功的主要要素在于其数据,而非模型架构或预训练目标。然而,CLIP仅提供了关于其数据及采集方式非常有限的信息,导致诸多工作试图通过其模型参数滤波来复现CLIP的数据。在本工作中,我们旨在揭示CLIP的数据策展方法,并为向社区开放之目的引入了元数据策展的语言-图像预训练(MetaCLIP)。MetaCLIP接收原始数据池与元数据(由CLIP的概念导出),并产出关于元数据分布的均衡子集。我们的实验研究严格隔离了模型与训练设置,仅聚焦于数据。将MetaCLIP应用于含400M图像-文本对的CommonCrawl,在多个标准基准上优于CLIP的数据。在零样本ImageNet分类中,MetaCLIP在ViT-B模型上达到70.8%准确率,超越CLIP的68.3%。在相同训练预算下扩展到1B数据,达到72.4%。我们的观察跨多种模型尺寸成立,如ViT-H在无任何额外技巧下达到80.5%。策展代码与基于元数据的训练数据分布发布于https://github.com/facebookresearch/MetaCLIP。

关键词

引用

@article{arxiv.2309.16671,
  title  = {Demystifying CLIP Data},
  author = {Hu Xu and Saining Xie and Xiaoqing Ellen Tan and Po-Yao Huang and Russell Howes and Vasu Sharma and Shang-Wen Li and Gargi Ghosh and Luke Zettlemoyer and Christoph Feichtenhofer},
  journal= {arXiv preprint arXiv:2309.16671},
  year   = {2025}
}

备注

17 pages. arXiv admin note: text overlap with arXiv:2103.00020 by other authors