中文

Pile数据集说明表

计算与语言 2022-01-20 v1

摘要

本说明表描述了Pile,一个由EleutherAI编译的、用于大规模语言建模的825 GiB人类撰写文本数据集。Pile由22个不同的文本来源组成,范围从为本项目所做的原始抓取,到数据所有者提供的文本数据,再到网上可用的第三方抓取。

关键词

引用

@article{arxiv.2201.07311,
  title  = {Datasheet for the Pile},
  author = {Stella Biderman and Kieran Bicheno and Leo Gao},
  journal= {arXiv preprint arXiv:2201.07311},
  year   = {2022}
}

备注

Accompanies "The Pile: An 800GB Dataset of Diverse Text for Language Modeling" arXiv:2101.00027