中文

下游数据集作为预训练语料出奇地有效

计算与语言 2023-05-29 v2 机器学习

摘要

对于大多数自然语言处理任务,主流做法是使用较小的下游数据集对大型预训练 transformer 模型(如 BERT)进行微调。尽管该方法取得成功,但尚不清楚这些收益在多大程度上归因于用于预训练的庞大数据背景语料, versus 预训练目标本身。本文引入一项关于自预训练的大规模研究,其中相同的(下游)训练数据用于预训练与微调。在涉及 ELECTRA 与 RoBERTa 模型以及 10 个不同下游分类数据集的实验中,我们观察到自预训练可与在 BookWiki 语料上的标准预训练相媲美(尽管使用少约 10×10\times--500×500\times 的数据),并分别在后者的 77 个和 55 个数据集上更优。令人惊讶的是,这些任务特定的预训练模型在其他任务(包括 GLUE 基准)上往往表现良好。除分类任务外,自预训练在基于跨度的问答与常识推理等结构化输出预测任务上也带来益处,常提供超过在 BookWiki 语料上预训练所带来性能提升的 50%50\%。我们的结果暗示,在许多场景中,归因于预训练的性能增益主要由预训练目标本身驱动,并非总可归因于大规模外部预训练数据的使用。这些发现鉴于对网络规模预训练数据中知识产权与攻击性内容的担忧尤为相关。

关键词

引用

@article{arxiv.2209.14389,
  title  = {Downstream Datasets Make Surprisingly Good Pretraining Corpora},
  author = {Kundan Krishna and Saurabh Garg and Jeffrey P. Bigham and Zachary C. Lipton},
  journal= {arXiv preprint arXiv:2209.14389},
  year   = {2023}
}

备注

ACL2023 Camera Ready