中文

LAION-5B:用于训练下一代图像-文本模型的开放大规模数据集

计算机视觉与模式识别 2022-10-18 v1 人工智能 机器学习

摘要

CLIP 与 DALL-E 等开创性语言-视觉架构证明了在大量噪声图像-文本数据上训练而不依赖标准视觉单模态监督学习中使用的昂贵精确标签的效用。所得模型展现出强文本引导图像生成与向下游任务迁移的能力,同时在零样本分类中表现卓越且具有值得注意的分布外鲁棒性。此后,ALIGN、BASIC、GLIDE、Flamingo 与 Imagen 等大规模语言-视觉模型取得了进一步改进。研究此类模型的训练与能力需要包含数十亿图像-文本对的数据集。迄今,此等规模的数据集尚未向更广泛的研究界开放提供。为解决此问题并使大规模多模态模型研究民主化,我们提出 LAION-5B——一个由 58.5 亿经 CLIP 过滤的图像-文本对组成的数据集,其中 23.2 亿包含英语语言。我们展示了使用该数据集对 CLIP、GLIDE 与 Stable Diffusion 等基础模型的成功复现与微调,并讨论了利用此规模开放数据集所赋能的进一步实验。此外,我们提供了若干最近邻索引、用于数据集探索与子集生成的改进网页界面,以及用于水印、NSFW 与有毒内容检测的检测分数。公告页 https://laion.ai/laion-5b-a-new-era-of-open-large-scale-multi-modal-datasets/

关键词

引用

@article{arxiv.2210.08402,
  title  = {LAION-5B: An open large-scale dataset for training next generation image-text models},
  author = {Christoph Schuhmann and Romain Beaumont and Richard Vencu and Cade Gordon and Ross Wightman and Mehdi Cherti and Theo Coombes and Aarush Katta and Clayton Mullis and Mitchell Wortsman and Patrick Schramowski and Srivatsa Kundurthy and Katherine Crowson and Ludwig Schmidt and Robert Kaczmarczyk and Jenia Jitsev},
  journal= {arXiv preprint arXiv:2210.08402},
  year   = {2022}
}

备注

36th Conference on Neural Information Processing Systems (NeurIPS 2022), Track on Datasets and Benchmarks. OpenReview: https://openreview.net/forum?id=M3Y74vmsMcY