中文

LAION-400M:经CLIP过滤的4亿图像-文本对开放数据集

计算机视觉与模式识别 2021-11-04 v1 计算与语言 机器学习

摘要

在数亿图像-文本对上训练的多模态语言-视觉模型(例如CLIP、DALL-E)近期激增,展现出在目标图像数据上缺乏逐样本标签的情况下,执行零样本或少样本学习及迁移的卓越能力。尽管有此趋势,迄今为止尚无足够规模的公开数据集用于从头训练此类模型。为解决此问题,我们通过社区努力构建并公开发布了LAION-400M,这是一个包含经CLIP过滤的4亿图像-文本对、其CLIP嵌入以及允许高效相似性搜索的kNN索引的数据集。

关键词

引用

@article{arxiv.2111.02114,
  title  = {LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs},
  author = {Christoph Schuhmann and Richard Vencu and Romain Beaumont and Robert Kaczmarczyk and Clayton Mullis and Aarush Katta and Theo Coombes and Jenia Jitsev and Aran Komatsuzaki},
  journal= {arXiv preprint arXiv:2111.02114},
  year   = {2021}
}

备注

Short version. Accepted at Data Centric AI NeurIPS Workshop 2021