中文

面向非任务特定 BERT 蒸馏的句子表示近似方法

计算与语言 2020-04-08 v1

摘要

近来,由于其有效性与通用性,BERT 已成为各类 NLP 深度模型的基本组成部分。然而,BERT 的在线部署常受其大规模参数与高计算成本的阻碍。大量研究表明知识蒸馏能高效地将 BERT 的知识迁移至参数规模更小的模型。然而,当前的 BERT 蒸馏方法主要关注任务指定的蒸馏,此类方法导致 BERT 通用语义知识在通用性上的损失。本文提出一种以句子表示近似为导向的蒸馏框架,可在不指定任务的情况下将预训练 BERT 蒸馏为基于简单 LSTM 的模型。与 BERT 一致,我们的蒸馏模型能够通过微调执行迁移学习以适配任意句子级下游任务。此外,我们的模型可进一步与任务特定的蒸馏流程协作。GLUE 基准上多个 NLP 任务的实验结果表明,我们的方法优于其他任务特定的蒸馏方法甚至更大的模型(如 ELMO),且效率得到显著提升。

关键词

引用

@article{arxiv.2004.03097,
  title  = {Towards Non-task-specific Distillation of BERT via Sentence Representation Approximation},
  author = {Bowen Wu and Huan Zhang and Mengyuan Li and Zongsheng Wang and Qihang Feng and Junhong Huang and Baoxun Wang},
  journal= {arXiv preprint arXiv:2004.03097},
  year   = {2020}
}