中文

DataComp:探索下一代多模态数据集

计算机视觉与模式识别 2023-10-23 v5 计算与语言 机器学习

摘要

多模态数据集是近期诸如 Stable Diffusion 和 GPT-4 等重大突破的关键组成部分,然而其设计并未获得与模型架构或训练算法同等的研究关注。为了解决机器学习生态系统中的这一不足,我们推出了 DataComp,这是一个以来自 Common Crawl 的 128 亿图文对组成的新候选池为中心的数据集实验测试平台。我们基准测试的参与者设计新的过滤技术或整理新的数据源,然后通过运行我们标准化的 CLIP 训练代码并在 38 个下游测试集上测试所得模型,来评估他们的新数据集。我们的基准测试包含跨越四个数量级的多种计算规模,这使得研究缩放趋势成为可能,并使拥有不同资源的研究人员都能使用该基准测试。我们的基线实验表明,DataComp 工作流能够生成更好的训练集。具体而言,我们最佳的基线 DataComp-1B,使得从零开始训练的 CLIP ViT-L/14 在 ImageNet 上达到 79.2% 的零样本准确率,在使用相同训练程序和计算量的情况下,比 OpenAI 的 CLIP ViT-L/14 高出 3.7 个百分点。我们在 www.datacomp.ai 发布了 DataComp 及所有相关代码。

关键词

引用

@article{arxiv.2304.14108,
  title  = {DataComp: In search of the next generation of multimodal datasets},
  author = {Samir Yitzhak Gadre and Gabriel Ilharco and Alex Fang and Jonathan Hayase and Georgios Smyrnis and Thao Nguyen and Ryan Marten and Mitchell Wortsman and Dhruba Ghosh and Jieyu Zhang and Eyal Orgad and Rahim Entezari and Giannis Daras and Sarah Pratt and Vivek Ramanujan and Yonatan Bitton and Kalyani Marathe and Stephen Mussmann and Richard Vencu and Mehdi Cherti and Ranjay Krishna and Pang Wei Koh and Olga Saukh and Alexander Ratner and Shuran Song and Hannaneh Hajishirzi and Ali Farhadi and Romain Beaumont and Sewoong Oh and Alex Dimakis and Jenia Jitsev and Yair Carmon and Vaishaal Shankar and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2304.14108},
  year   = {2023}
}

备注

NeurIPS 2023 Datasets and Benchmarks Track