中文

MINT-1T:将开源多模态数据规模提升10倍:一个拥有一万亿标记的多模态数据集

计算机视觉与模式识别 2024-11-01 v5 机器学习

摘要

包含自由形式图像和文本交错序列的多模态数据集对于训练前沿大型多模态模型 (LMM)至关重要。尽管开源LMM的快速发展,但仍存在大规模、多样化的开源多模态交错数据集的显著不足。为此,我们引入MINT-1T,目前最广泛且多样化的开源多模态INTerleaved数据集。MINT-1T包含一万亿个文本标记和34亿张图像,规模是现有开源数据集的10倍。此外,我们包括此前未利用的来源,如PDF和ArXiv论文。由于构建大规模多模态交错数据集需要大量工程努力,分享数据 curated 过程并发布数据集对社区大有裨益。我们的实验表明,在MINT-1T上训练的LMM性能与在前一领先数据集OBELICS上训练的模型相当。我们的数据和代码将发布在https://github.com/mlfoundations/MINT-1T。

关键词

引用

@article{arxiv.2406.11271,
  title  = {MINT-1T: Scaling Open-Source Multimodal Data by 10x: A Multimodal Dataset with One Trillion Tokens},
  author = {Anas Awadalla and Le Xue and Oscar Lo and Manli Shu and Hannah Lee and Etash Kumar Guha and Matt Jordan and Sheng Shen and Mohamed Awadalla and Silvio Savarese and Caiming Xiong and Ran Xu and Yejin Choi and Ludwig Schmidt},
  journal= {arXiv preprint arXiv:2406.11271},
  year   = {2024}
}