CCI4.0:面向增强大语言模型推理的双语预训练数据集
计算与语言
2025-06-10 v1 人工智能
摘要
我们介绍 CCI4.0,这是一个大规模双语预训练数据集,旨在实现卓越的数据质量和多样化的人类类推理轨迹。CCI4.0 约占 35 TB 磁盘空间,包含两个子数据集:CCI4.0-M2-Base 和 CCI4.0-M2-CoT。CCI4.0-M2-Base 将 5.2 TB 的精心筛选的中文网页语料、22.5 TB 的 Nemotron-CC 英文子集,以及来自数学、wiki、arxiv 和 code 的多样来源数据相结合。虽然这些数据大多来自已处理完毕的数据集,但各领域的质量标准是动态的,需要大量的专业经验和劳动力进行处理。因此,我们提出了一种新颖的 pipeline,主要基于模型来判断数据质量,包括两阶段去重、多分类质量评分和领域感知的流畅度过滤。我们提取了 45 亿条 CoT(链路思考)模板,命名为 CCI4.0-M2-CoT。不同于从更大模型中提取 CoT 我们的提出的分阶段 CoT 提取体现了多样化的推理模式,显著降低了幻觉的可能性。实证评估表明,预训练于 CCI4.0 的大语言模型能获得更清洁、更可靠的训练信号,在下游任务中实现持续的性能提升,尤其在数学和代码反思任务中表现尤为突出。我们的结果凸显了严格数据精细整理和人类思考模板在推动大语言模型性能方面的关键作用,为自动处理预训练语料库提供了一些启示。
引用
@article{arxiv.2506.07463,
title = {CCI4.0: A Bilingual Pretraining Dataset for Enhancing Reasoning in Large Language Models},
author = {Guang Liu and Liangdong Wang and Jijie Li and Yang Yu and Yao Xu and Jiabei Chen and Yu Bai and Feng Liao and Yonghua Lin},
journal= {arXiv preprint arXiv:2506.07463},
year = {2025}
}