中文

ChineseWebText 2.0:大规模高质量带多维细粒度信息的中文网页文本

计算与语言 2024-12-02 v1 人工智能

摘要

在大型语言模型(LLM)的开发过程中,预训练数据在塑造 LLM 能力方面起着关键作用。近年来,已发布多个大规模高质量的预训练数据集,以加速 LLM 的研究,包括 ChineseWebText1.0、C4、Pile、WanJuan、MAPCC 等。然而,随着 LLM 的不断演进,关注力度正逐渐转向特定领域的能力和安全问题,使得这些以粗粒度文本为主的以往数据集不足以满足训练需求。此外,细粒度信息(如质量、领域和有害程度)在构建强大且可靠的 LLM 以满足各种场景需求方面日益重要。为此,本文提出了一种名为 MDFG-tool 的新型工具链,用于构建具有多维细粒度信息的大规模高质量中文数据集。首先,我们采用人工制定的规则过滤掉原始内容中的显式噪声文本。其次,设计了质量评估模型、领域分类器和有害程度评估模型,对剩余清洗后的数据进行评估。最后,我们将这些三类细粒�信息整合到每条文本中。通过上述方法,我们发布了目前规模最大、质量最高且具有细粒度信息的中文文本数据集 ChineseWebText2.0,该数据集包含 3.8TB,每条文本都关联有质量分数、领域标签、有害程度标签及有害程度分数,便于 LLM 研究者根据各种类型的细粒度信息选择数据。该数据、代码及工具链已在本网站 https://github.com/CASIA-LM/ChineseWebText-2.0 上提供。

关键词

引用

@article{arxiv.2411.19668,
  title  = {ChineseWebText 2.0: Large-Scale High-quality Chinese Web Text with Multi-dimensional and fine-grained information},
  author = {Wanyue Zhang and Ziyong Li and Wen Yang and Chunlin Leng and Yinan Bai and Qianlong Du and Chengqing Zong and Jiajun Zhang},
  journal= {arXiv preprint arXiv:2411.19668},
  year   = {2024}
}

备注

ChineseWebTex2.0 dataset is available at https://github.com/CASIA-LM/ChineseWebText-2.0