中文

饱读的学生学得更好:论预训练紧凑模型的重要性

计算与语言 2019-09-27 v2

摘要

自然语言表示的最新进展伴随着庞大而昂贵的模型,这些模型通过自监督预训练利用大量通用领域文本。由于将此类模型应用于下游任务的成本,已有若干针对预训练语言表示的模型压缩技术被提出(Sun et al., 2019; Sanh, 2019)。然而令人惊讶的是,仅进行预训练并微调紧凑模型这一简单基线却被忽视了。在本文中,我们首先表明预训练在较小架构背景下仍然重要,且微调预训练的紧凑模型可媲美同期工作中提出的更复杂方法。从预训练紧凑模型出发,我们进而探索通过标准知识蒸馏从大型微调模型迁移任务知识。由此得到的简单而有效且通用的算法——预训练蒸馏(Pre-trained Distillation),带来了进一步改进。通过大量实验,我们更一般地探究了预训练与蒸馏在两个未被充分研究的变量——模型大小与无标签任务数据属性——下的相互作用。一个令人惊讶的观察是,即使顺序应用于同一数据时,它们也具有复合效应。为加速未来研究,我们将公开我们的 24 个预训练微型 BERT 模型。

关键词

引用

@article{arxiv.1908.08962,
  title  = {Well-Read Students Learn Better: On the Importance of Pre-training Compact Models},
  author = {Iulia Turc and Ming-Wei Chang and Kenton Lee and Kristina Toutanova},
  journal= {arXiv preprint arXiv:1908.08962},
  year   = {2019}
}

备注

Added comparison to concurrent work