利用pQRNN将大语言模型蒸馏为微小而高效的学生模型
计算与语言
2021-01-25 v1 人工智能
摘要
像mBERT、XLM-R这样的大型预训练多语言模型在语言理解任务上取得了最先进的结果。然而,它们并不适合服务器和边缘设备上对延迟敏感的应用。降低这些模型所需的内存和计算资源十分重要。为此,我们提出pQRNN,一种基于投影、无嵌入的神经网络编码器,它微小且对自然语言处理任务有效。无需预训练,pQRNN尽管比带预训练嵌入的LSTM模型小140倍,却显著优于后者。在参数量相同的情况下,它们优于transformer基线,从而展示了其参数效率。此外,我们表明pQRNN是蒸馏大型预训练语言模型的有效学生架构。我们进行了细致的消融实验,研究pQRNN参数、数据增强和蒸馏设置的影响。在具有挑战性的多语言语义解析数据集MTOP上,pQRNN学生在仅为mBERT教师模型1/350大小的情况下达到了其95.9%的性能。在流行的解析任务mATIS上,pQRNN学生平均能达到教师的97.1%,同样小350倍。我们的强劲结果表明,我们的方法非常适用于对延迟敏感的应用,同时能够利用大型mBERT类模型。
引用
@article{arxiv.2101.08890,
title = {Distilling Large Language Models into Tiny and Effective Students using pQRNN},
author = {Prabhu Kaliamoorthi and Aditya Siddhant and Edward Li and Melvin Johnson},
journal= {arXiv preprint arXiv:2101.08890},
year = {2021}
}