中文

Alexa教师模型:面向自然语言理解系统预训练与蒸馏十亿级参数编码器

计算与语言 2022-06-17 v1 人工智能 机器学习

摘要

我们展示了一项大规模实验的结果,该实验对参数量(不含嵌入层)从7亿到93亿的编码器进行预训练,随后将其蒸馏为参数量从1700万到1.7亿的更小模型,并应用于虚拟助手系统的自然语言理解(NLU)组件。尽管我们使用70%的口语形式数据进行训练,但当在书面形式的跨语言自然语言推理(XNLI)语料库上评估时,我们的教师模型表现与XLM-R和mT5相当。我们使用来自本系统的领域内数据对教师模型进行第二阶段预训练,使意图分类的错误率相对降低3.86%,槽填充的相对错误率降低7.01%。我们发现,即便是从我们第二阶段教师模型蒸馏出的1.7亿参数模型,与仅在公开数据(第一阶段)上训练的23亿参数教师模型相比,意图分类错误率优2.88%,槽填充错误率优7.69%,这凸显了领域内数据对预训练的重要性。在使用带标注NLU数据进行离线评估时,我们1700万参数的第二阶段蒸馏模型分别优于XLM-R Base(8500万参数)和DistillBERT(4200万参数)4.23%至6.14%。最后,我们给出了来自完整虚拟助手实验平台的结果,发现使用我们的预训练与蒸馏流程训练的模型,在系统级用户不满意度的自动度量上,比从8500万参数教师蒸馏的模型优3.74%–4.91%。

关键词

引用

@article{arxiv.2206.07808,
  title  = {Alexa Teacher Model: Pretraining and Distilling Multi-Billion-Parameter Encoders for Natural Language Understanding Systems},
  author = {Jack FitzGerald and Shankar Ananthakrishnan and Konstantine Arkoudas and Davide Bernardi and Abhishek Bhagia and Claudio Delli Bovi and Jin Cao and Rakesh Chada and Amit Chauhan and Luoxin Chen and Anurag Dwarakanath and Satyam Dwivedi and Turan Gojayev and Karthik Gopalakrishnan and Thomas Gueudre and Dilek Hakkani-Tur and Wael Hamza and Jonathan Hueser and Kevin Martin Jose and Haidar Khan and Beiye Liu and Jianhua Lu and Alessandro Manzotti and Pradeep Natarajan and Karolina Owczarzak and Gokmen Oz and Enrico Palumbo and Charith Peris and Chandana Satya Prakash and Stephen Rawls and Andy Rosenbaum and Anjali Shenoy and Saleh Soltan and Mukund Harakere Sridhar and Liz Tan and Fabian Triefenbach and Pan Wei and Haiyang Yu and Shuai Zheng and Gokhan Tur and Prem Natarajan},
  journal= {arXiv preprint arXiv:2206.07808},
  year   = {2022}
}

备注

KDD 2022