中文

ChineseWebText:以有效评估模型抽取的大规模高质量中文网络文本

计算与语言 2023-11-13 v2

摘要

在大型语言模型(LLMs)的发展过程中,预训练数据的规模与质量对塑造 LLMs 的能力起着关键作用。为加速 LLMs 的研究,已公开发布若干大规模数据集,如 C4 [1]、Pile [2]、RefinedWeb [3] 与 WanJuan [4]。然而,已发布语料大多聚焦英文,且仍缺乏从网络数据抽取干净文本的完备工具链。此外,语料的细粒度信息(如各文本质量)缺失。为应对这些挑战,本文提出一种新的完备工具链 EvalWeb,从含噪网络数据中抽取中文干净文本。首先,与先前工作类似,采用人工制定规则从原始爬取网络内容中剔除显式噪声文本。其次,利用精心设计的评估模型对剩余较干净数据打分,为每个文本赋予特定质量分数。最后,可便捷地采用适当阈值筛选所需高质量中文预训练数据。利用所提方法,我们发布了最大且最新的大规模高质量中文网络文本 ChineseWebText,其包含 1.42 TB 且每文本附质量分数,便于 LLM 研究者按所需质量阈值选数。我们还发布了 600 GB 质量超 90% 的更干净子集。

关键词

引用

@article{arxiv.2311.01149,
  title  = {ChineseWebText: Large-scale High-quality Chinese Web Text Extracted with Effective Evaluation Model},
  author = {Jianghao Chen and Pu Jian and Tengxiao Xi and Dongyi Yi and Qianlong Du and Chenglin Ding and Guibo Zhu and Chengqing Zong and Jinqiao Wang and Jiajun Zhang},
  journal= {arXiv preprint arXiv:2311.01149},
  year   = {2023}
}