RedStone:为大型语言模型精选通用、代码、数学和问答数据的管道
计算与语言
2024-12-05 v1
摘要
在高质量、精心挑选的数据集上进行预训练被广泛认为是提升大型语言模型性能和泛化能力的关键因素。本研究探索了将 Common Crawl 作为全面且灵活资源,用于预训练大型语言模型的潜在价值,旨在解决通用语言理解和专业领域知识两方面的问题。我们引入了 RedStone,这是一个创新且可扩展的管道,用于从 Common Crawl 中提取和处理数据,从而 facilitate 创建大规模且多样化的预训练数据集。与需要昂贵挑选和领域特定专业知识的传统数据集不同,RedStone 利用 Common Crawl 的广度,提供面向广泛领域的数据集。本文通过构建多个领域的预训练数据集(包括通用语言理解、代码、数学和问答任务)来展示其能力。RedStone 的灵活性允许轻松适应其他专业领域,显著降低了创建有价值领域特定数据集的门槛。我们的发现表明,借助如 RedStone 这样有效的管道,Common Crawl 可作为丰富且可更新的预训练数据来源,为大型语言模型中的领域适应和知识发现开辔新途径。本工作还强调了创新数据获取策略的重要性,并凸显了 web 规模数据作为大型语言模型持续演进的强大资源的作用。RedStone 代码和数据样本将在 \url{https://aka.ms/redstone} 公开可用。
关键词
引用
@article{arxiv.2412.03398,
title = {RedStone: Curating General, Code, Math, and QA Data for Large Language Models},
author = {Yaoyao Chang and Lei Cui and Li Dong and Shaohan Huang and Yangyu Huang and Yupan Huang and Scarlett Li and Tengchao Lv and Shuming Ma and Qinzheng Sun and Wenhui Wang and Furu Wei and Ying Xin and Mao Yang and Qiufeng Yin and Xingxing Zhang},
journal= {arXiv preprint arXiv:2412.03398},
year = {2024}
}