中文

OpenCSG 中文语料库:面向大语言模型训练的高质量中文数据集系列

计算与语言 2025-01-15 v1

摘要

大语言模型(LLM)已展现出显著的能力,但其成功高度依赖于预训练语料的质量。对于中文 LLM 而言,高质量中文数据集的匮乏构成了重大挑战,往往限制了其性能。为解决这一问题,我们提出了 OpenCSG 中文语料库——一个专为 LLM 预训练、后训练和微调设计的高质量数据集系列。该语料库包括 Fineweb-edu-chinese、Fineweb-edu-chinese-v2、Cosmopedia-chinese 和 Smoltalk-chinese,各自具有鲜明特点:Fineweb-edu 数据集侧重于从多样化中文网络来源中筛选的高质量内容;Cosmopedia-chinese 提供用于知识密集型训练的合成教科书风格数据;Smoltalk-chinese 强调风格多样且以对话格式呈现的数据。OpenCSG 中文语料库以其高质量文本、覆盖领域的多样性以及可扩展、可复现的数据整理流程为特征。此外,我们进行了广泛的实验分析,包括在较小参数模型上的评估,结果表明在 C-Eval 等任务上取得了显著的性能提升,验证了该语料库在训练中文 LLM 方面的有效性。

关键词

引用

@article{arxiv.2501.08197,
  title  = {OpenCSG Chinese Corpus: A Series of High-quality Chinese Datasets for LLM Training},
  author = {Yijiong Yu and Ziyun Dai and Zekun Wang and Wei Wang and Ran Chen and Ji Pei},
  journal= {arXiv preprint arXiv:2501.08197},
  year   = {2025}
}

备注

The datasets are available on https://huggingface.co/collections/opencsg/chinese-fineweb-66cfed105f502ece8f29643e ; The code is on https://github.com/yuyijiong/fineweb-edu-chinese