中文

mOSCAR:一个大规模多语言多模态文档级语料库

计算与语言 2025-05-30 v2 计算机视觉与模式识别

摘要

多模态大语言模型(mLLMs)在大量文本-图像数据上进行训练。虽然大多数mLLMs仅在类似标题的数据上训练,但Alayrac等人(2022)表明,额外在文本和图像交错序列上训练可以导致上下文学习能力的涌现。然而,他们使用的数据集M3W并非公开,且仅为英文。已有重现其结果的尝试,但发布的数据集仅限于英文。相比之下,当前的多语言和多模态数据集要么仅由类似标题的数据组成,要么是中等规模或完全私有的数据。这限制了世界上其他7000种语言的mLLM研究。因此,我们引入了mOSCAR,据我们所知,这是第一个从网络爬取的大规模多语言多模态文档语料库。它涵盖163种语言、3.03亿个文档、2000亿个词元和11.5亿张图像。我们仔细进行了一系列过滤和评估步骤,以确保mOSCAR足够安全、多样且质量良好。我们还训练了两种类型的多语言模型以证明mOSCAR的优势:(1) 在mOSCAR子集和标题数据上训练的模型,(2) 仅在标题数据上训练的模型。额外在mOSCAR上训练的模型在各种多语言图像-文本任务和基准测试中显示出少样本学习性能的显著提升,证实了先前仅英文mLLMs的发现。该数据集根据知识共享CC BY 4.0许可发布,可在此处访问:https://huggingface.co/datasets/oscar-corpus/mOSCAR

关键词

引用

@article{arxiv.2406.08707,
  title  = {mOSCAR: A Large-scale Multilingual and Multimodal Document-level Corpus},
  author = {Matthieu Futeral and Armel Zebaze and Pedro Ortiz Suarez and Julien Abadji and Rémi Lacroix and Cordelia Schmid and Rachel Bawden and Benoît Sagot},
  journal= {arXiv preprint arXiv:2406.08707},
  year   = {2025}
}

备注

ACL 2025 (Findings)