用于Falcon LLM的RefinedWeb数据集:仅用网络数据即超越精心整理语料库
计算与语言
2023-06-05 v1 人工智能
摘要
大语言模型通常在一部分经过过滤的网络数据和精心整理的高质量语料库(如社交媒体对话、书籍或技术论文)的混合上训练。人们认为这种整理过程对于产生具有广泛零样本泛化能力的可性能模型是必要的。然而,考虑到需要以万亿级token进行预训练的更大模型,尚不清楚整理的可扩展性如何,以及我们是否会很快耗尽独特的高质量数据。与先前的观念不同,我们表明恰当过滤和去重的网络数据本身即可催生强大模型;甚至显著优于在The Pile上训练的state-of-the-art模型。尽管经过广泛过滤,我们从网络中提取的高质量数据依然充足,并能够从CommonCrawl获得五万亿token。我们公开发布了RefinedWeb数据集的6000亿token抽取,以及在其上训练的1.3/7.5B参数语言模型。
引用
@article{arxiv.2306.01116,
title = {The RefinedWeb Dataset for Falcon LLM: Outperforming Curated Corpora with Web Data, and Web Data Only},
author = {Guilherme Penedo and Quentin Malartic and Daniel Hesslow and Ruxandra Cojocaru and Alessandro Cappelli and Hamza Alobeidli and Baptiste Pannier and Ebtesam Almazrouei and Julien Launay},
journal= {arXiv preprint arXiv:2306.01116},
year = {2023}
}