中文

The Pile:一个用于语言建模的 800GB 多样化文本数据集

计算与语言 2021-01-05 v1

摘要

近期工作表明,增加训练数据集的多样性可提升大规模语言模型的通用跨领域知识及下游泛化能力。鉴于此,我们提出 \textit{the Pile}:一个面向大规模语言模型训练的 825 GiB 英文文本语料库。The Pile 由 22 个多样化高质量子集构成——既有已有子集也有新构建子集——其中许多源自学术或专业来源。我们对 GPT-2 和 GPT-3 在 the Pile 上未调优性能的评估显示,这些模型在其许多组成部分(如学术写作)上表现不佳。反之,在 the Pile 上训练的模型在 the Pile 的所有组成部分上均显著优于 Raw CC 和 CC-100,同时提升了下游评估性能。通过深入的探索性分析,我们记录了对于潜在用户而言可能值得关注的若干数据方面。我们公开了用于构建该语料库的代码。

关键词

引用

@article{arxiv.2101.00027,
  title  = {The Pile: An 800GB Dataset of Diverse Text for Language Modeling},
  author = {Leo Gao and Stella Biderman and Sid Black and Laurence Golding and Travis Hoppe and Charles Foster and Jason Phang and Horace He and Anish Thite and Noa Nabeshima and Shawn Presser and Connor Leahy},
  journal= {arXiv preprint arXiv:2101.00027},
  year   = {2021}
}