Pile数据集说明表
计算与语言
2022-01-20 v1
摘要
本说明表描述了Pile,一个由EleutherAI编译的、用于大规模语言建模的825 GiB人类撰写文本数据集。Pile由22个不同的文本来源组成,范围从为本项目所做的原始抓取,到数据所有者提供的文本数据,再到网上可用的第三方抓取。
关键词
引用
@article{arxiv.2201.07311,
title = {Datasheet for the Pile},
author = {Stella Biderman and Kieran Bicheno and Leo Gao},
journal= {arXiv preprint arXiv:2201.07311},
year = {2022}
}
备注
Accompanies "The Pile: An 800GB Dataset of Diverse Text for Language Modeling" arXiv:2101.00027