LAION-400M:经CLIP过滤的4亿图像-文本对开放数据集
计算机视觉与模式识别
2021-11-04 v1 计算与语言
机器学习
摘要
在数亿图像-文本对上训练的多模态语言-视觉模型(例如CLIP、DALL-E)近期激增,展现出在目标图像数据上缺乏逐样本标签的情况下,执行零样本或少样本学习及迁移的卓越能力。尽管有此趋势,迄今为止尚无足够规模的公开数据集用于从头训练此类模型。为解决此问题,我们通过社区努力构建并公开发布了LAION-400M,这是一个包含经CLIP过滤的4亿图像-文本对、其CLIP嵌入以及允许高效相似性搜索的kNN索引的数据集。
引用
@article{arxiv.2111.02114,
title = {LAION-400M: Open Dataset of CLIP-Filtered 400 Million Image-Text Pairs},
author = {Christoph Schuhmann and Richard Vencu and Romain Beaumont and Robert Kaczmarczyk and Clayton Mullis and Aarush Katta and Theo Coombes and Jenia Jitsev and Aran Komatsuzaki},
journal= {arXiv preprint arXiv:2111.02114},
year = {2021}
}
备注
Short version. Accepted at Data Centric AI NeurIPS Workshop 2021