中文

面向数据高效语言模型的 MiniPile 挑战

计算与语言 2023-04-18 v1 机器学习

摘要

预训练文本语料库日益增长的多样性使语言模型具备跨多种下游任务的泛化能力。然而,此类多样数据集通常对学术预算而言过大;因此,大多数关于 Transformer 架构、训练流程、优化器等的研究在较小的同质数据集上进行。为此,我们提出 MiniPile 挑战,要求在一个至多含 1M 文档的多样文本语料库上预训练语言模型。MiniPile 是去重后 825GB 的 The Pile 语料库的 6GB 子集。为策划 MiniPile,我们执行简单的三步数据过滤流程:我们 (1) 推断 Pile 所有文档的嵌入,(2) 使用 kk-means 聚类嵌入空间,(3) 过滤掉低质量簇。为验证 MiniPile 适用于语言模型预训练,我们用它预训练 BERT 和 T5 模型,在 GLUE 和 SNI 基准上相较使用 2.62.6x/745745x 数据量的原始预训练检查点仅分别带来 1.9%1.9\%/2.5%2.5\% 的性能下降。MiniPile 可在 https://huggingface.co/datasets/JeanKaddour/minipile 获取。

关键词

引用

@article{arxiv.2304.08442,
  title  = {The MiniPile Challenge for Data-Efficient Language Models},
  author = {Jean Kaddour},
  journal= {arXiv preprint arXiv:2304.08442},
  year   = {2023}
}