万卷:用于推进中英文大模型的综合多模态数据集
计算与语言
2023-09-18 v3 计算机视觉与模式识别
摘要
ChatGPT 和 GPT-4 的流行显著加速了大模型的发展,催生了众多令人瞩目的大语言模型(LLM)和多模态大语言模型(MLLM)。这些前沿模型卓越的性能归功于高质量数据。然而,领先范式所用训练数据的细节往往保密。这种缺乏透明度的状况,加上开源数据的稀缺,阻碍了社区内的进一步发展。作为回应,本文提出“万卷”(Wan Juan),一个由中英文数据组成的大规模多模态数据集,采集自广泛的网络来源。该数据集包含文本、图文和视频模态,总规模超过 2TB。它被用于 InternLM 的训练,该模型在与同等规模模型的多维度评估中展现出显著优势。所有数据可在 https://opendatalab.org.cn/WanJuan1.0 获取。
引用
@article{arxiv.2308.10755,
title = {WanJuan: A Comprehensive Multimodal Dataset for Advancing English and Chinese Large Models},
author = {Conghui He and Zhenjiang Jin and Chao Xu and Jiantao Qiu and Bin Wang and Wei Li and Hang Yan and Jiaqi Wang and Dahua Lin},
journal= {arXiv preprint arXiv:2308.10755},
year = {2023}
}
备注
Technical Report