中文

用于预训练多语言语言模型的语义知识多级蒸馏

计算与语言 2022-11-03 v1

摘要

预训练多语言语言模型在跨语言自然语言理解任务中发挥着重要作用。然而,现有方法未关注表示语义结构的学习,因而无法优化其性能。本文中,我们提出多级多语言知识蒸馏(MMKD),一种改进多语言语言模型的新方法。具体而言,我们采用师生框架来吸收英文BERT中丰富的语义表示知识。我们提出词元级、词级、句子级和结构级对齐目标,以鼓励源-目标对之间多级的一致性以及师生模型之间的相关性相似度。我们在包括XNLI、PAWS-X和XQuAD的跨语言评测基准上进行了实验。实验结果表明,MMKD在XNLI和XQuAD上优于其他同等规模的基线模型,并在PAWS-X上取得可比性能。特别地,MMKD在低资源语言上获得了显著的性能提升。

关键词

引用

@article{arxiv.2211.01200,
  title  = {Multi-level Distillation of Semantic Knowledge for Pre-training Multilingual Language Model},
  author = {Mingqi Li and Fei Ding and Dan Zhang and Long Cheng and Hongxin Hu and Feng Luo},
  journal= {arXiv preprint arXiv:2211.01200},
  year   = {2022}
}

备注

accepted at EMNLP 2022