中文

万卷:用于推进中英文大模型的综合多模态数据集

计算与语言 2023-09-18 v3 计算机视觉与模式识别

摘要

ChatGPT 和 GPT-4 的流行显著加速了大模型的发展,催生了众多令人瞩目的大语言模型(LLM)和多模态大语言模型(MLLM)。这些前沿模型卓越的性能归功于高质量数据。然而,领先范式所用训练数据的细节往往保密。这种缺乏透明度的状况,加上开源数据的稀缺,阻碍了社区内的进一步发展。作为回应,本文提出“万卷”(Wan Juan),一个由中英文数据组成的大规模多模态数据集,采集自广泛的网络来源。该数据集包含文本、图文和视频模态,总规模超过 2TB。它被用于 InternLM 的训练,该模型在与同等规模模型的多维度评估中展现出显著优势。所有数据可在 https://opendatalab.org.cn/WanJuan1.0 获取。

关键词

引用

@article{arxiv.2308.10755,
  title  = {WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models},
  author = {Conghui He and Zhenjiang Jin and Chao Xu and Jiantao Qiu and Bin Wang and Wei Li and Hang Yan and Jiaqi Wang and Dahua Lin},
  journal= {arXiv preprint arXiv:2308.10755},
  year   = {2023}
}

备注

Technical Report