中文

XtremeDistil:面向海量多语言模型的多阶段蒸馏

计算与语言 2020-05-06 v2 机器学习

摘要

深层且大型的预训练语言模型是各类自然语言处理任务的当前最优方法。然而,这些模型的巨大规模可能阻碍其实际应用。一些近期及并行工作使用知识蒸馏将这些庞大模型压缩为浅层模型。本工作中,我们研究知识蒸馏,重点关注多语言命名实体识别(NER)。具体而言,我们研究若干蒸馏策略,并提出一种利用教师内部表示的阶段式优化方案,该方案与教师架构无关,并表明其优于先前工作所采用的策略。此外,我们考察了若干因素的作用,如未标注数据量、标注资源、模型架构和推理延迟等。我们表明,我们的方法在批量推理时可对类 MBERT 的教师模型实现高达 35 倍参数压缩与 51 倍延迟压缩,同时在 41 种语言上保留其 NER F1 分数的 95%。

关键词

引用

@article{arxiv.2004.05686,
  title  = {XtremeDistil: Multi-stage Distillation for Massive Multilingual Models},
  author = {Subhabrata Mukherjee and Ahmed Awadallah},
  journal= {arXiv preprint arXiv:2004.05686},
  year   = {2020}
}

备注

To appear in ACL 2020