中文

OBELICS:一个开放的网络规模交错图文文档过滤数据集

信息检索 2023-08-22 v2 计算机视觉与模式识别

摘要

在自然文档(图像与文本交错排列)上训练的大型多模态模型,在各种多模态基准上优于在图文对上训练的模型。然而,用于训练这些模型的数据集尚未发布,且收集过程未完全说明。我们介绍了OBELICS数据集,这是一个开放的网络规模交错图文文档过滤数据集,包含从Common Crawl提取的1.41亿个网页、3.53亿张关联图像和1150亿文本词元。我们描述了数据集创建过程,给出了全面的过滤规则,并对数据集内容进行了分析。为展示OBELICS的可行性,我们训练了名为IDEFICS的90亿和800亿参数的视觉与语言模型,并在不同多模态基准上取得了有竞争力的性能。我们发布了数据集、模型和代码。

关键词

引用

@article{arxiv.2306.16527,
  title  = {OBELICS: An Open Web-Scale Filtered Dataset of Interleaved Image-Text Documents},
  author = {Hugo Laurençon and Lucile Saulnier and Léo Tronchon and Stas Bekman and Amanpreet Singh and Anton Lozhkov and Thomas Wang and Siddharth Karamcheti and Alexander M. Rush and Douwe Kiela and Matthieu Cord and Victor Sanh},
  journal= {arXiv preprint arXiv:2306.16527},
  year   = {2023}
}