中文

Muppet:基于预微调的大规模多任务表示

计算与语言 2021-01-28 v1 机器学习

摘要

我们提出预微调(pre-finetuning),即语言模型预训练与微调之间的一个额外大规模学习阶段。预微调是大规模多任务学习(约50个数据集,总计超过480万标注样本),旨在鼓励学习能更好地泛化到许多不同任务的表示。我们表明,预微调在广泛任务(句子预测、常识推理、机器阅读理解等)上持续提升了预训练判别模型(如RoBERTa)和生成模型(如BART)的性能,同时在微调期间显著提高了样本效率。我们还表明大规模多任务至关重要;当使用的任务较少时预微调可能损害性能,直到一个临界点(通常多于15个任务)之后性能随任务数量线性提升。

关键词

引用

@article{arxiv.2101.11038,
  title  = {Muppet: Massive Multi-task Representations with Pre-Finetuning},
  author = {Armen Aghajanyan and Anchit Gupta and Akshat Shrivastava and Xilun Chen and Luke Zettlemoyer and Sonal Gupta},
  journal= {arXiv preprint arXiv:2101.11038},
  year   = {2021}
}