中文

CCI3.0-HQ:面向大语言模型预训练的高质量大规模中文数据集

计算与语言 2024-10-28 v2

摘要

我们提出了 CCI3.0-HQ(https://huggingface.co/datasets/BAAI/CCI3-HQ),这是一套规模为 500GB 的高质量中文语料子集,源自中文互联网语料库 3.0(CCI3.0,https://huggingface.co/datasets/BAAI/CCI3-Data),通过创新的两阶段混合过滤流程显著提升了数据质量。为评估其效果,我们在 1000 亿 token 上从零训练了一个 0.5B 参数模型,实验结果表明其在零样本设置下在 10 个基准任务上优于 CCI3.0、SkyPile 和 WanjuanV1。高质量过滤过程有效地将 Qwen2-72B-instruct 模型的能力蒸馏到了紧凑的 0.5B 模型中,实现了中文网页数据分类的最佳 F1 分数。我们认为这套开放获取的数据集将促进更广泛的高质量语言模型获取。

关键词

引用

@article{arxiv.2410.18505,
  title  = {CCI3.0-HQ: a large-scale Chinese dataset of high quality designed for pre-training large language models},
  author = {Liangdong Wang and Bo-Wen Zhang and Chengwei Wu and Hanyu Zhao and Xiaofeng Shi and Shuhao Gu and Jijie Li and Quanyue Ma and TengFei Pan and Guang Liu},
  journal= {arXiv preprint arXiv:2410.18505},
  year   = {2024}
}