中文

利用多教师蒸馏罗马尼亚语 BERT 的知识

计算与语言 2022-04-14 v3 机器学习

摘要

在计算受限环境中运行大规模预训练语言模型仍是一个尚待解决的挑战性问题,而从这些模型进行迁移学习已在自然语言处理任务中变得普遍。此前已提出若干解决方案,包括知识蒸馏、网络量化和网络剪枝;然而,这些方法大多聚焦于英语,从而在考虑低资源语言时扩大了差距。本工作中,我们为罗马尼亚语引入了三个轻量且快速的蒸馏 BERT 模型:Distil-BERT-base-ro、Distil-RoBERT-base 和 DistilMulti-BERT-base-ro。前两个模型由文献中两个罗马尼亚语 BERT 基础版本各自的知识蒸馏得到,最后一个则通过蒸馏它们的集成得到。据我们所知,这是首次尝试创建公开可用的罗马尼亚语蒸馏 BERT 模型,我们在五项任务上对其进行了充分评估:词性标注、命名实体识别、情感分析、语义文本相似度和方言识别。我们的实验结果表明,三个蒸馏模型提供了与教师模型相当的性能,同时在 GPU 上快一倍且体积小约 35%。此外,我们通过度量标签忠诚度和概率忠诚度,以及回归忠诚度(本工作引入的新指标),进一步测试了学生模型与教师模型预测之间的相似性。

关键词

引用

@article{arxiv.2112.12650,
  title  = {Distilling the Knowledge of Romanian BERTs Using Multiple Teachers},
  author = {Andrei-Marius Avram and Darius Catrina and Dumitru-Clementin Cercel and Mihai Dascălu and Traian Rebedea and Vasile Păiş and Dan Tufiş},
  journal= {arXiv preprint arXiv:2112.12650},
  year   = {2022}
}

备注

10 pages, accepted to LREC2022 in the main conference