RefBERT:通过参考预计算表示压缩 BERT
计算与语言
2021-06-17 v1 机器学习
摘要
近年来开发的大型预训练语言模型(如 BERT)在许多下游自然语言处理应用中取得了卓越性能。这些预训练语言模型通常包含数亿参数,并在实际应用中面临高计算量和延迟的问题。人们期望在保持下游应用模型性能的同时,降低模型的计算开销以实现快速训练和推理。已有若干工作利用知识蒸馏将教师模型压缩为更小的学生模型。然而,它们通常在推理时丢弃教师的知识。不同的是,本文提出 RefBERT,利用从教师学到的知识,即借助参考样本上预计算的 BERT 表示,并将 BERT 压缩为更小的学生模型。为保证我们的方案,我们对损失函数及参考样本的使用提供了理论依据。显著地,理论结果表明,在参考样本上纳入教师预计算的表示确实增加了学生学习过程中的互信息。最后,我们进行了实证评估,表明我们的 RefBERT 比原始 TinyBERT 高出 8.1%,并在 GLUE 基准上达到 94% 以上的性能。同时,RefBERT 在推理上比 BERT 小 7.4 倍、快 9.5 倍。
引用
@article{arxiv.2106.08898,
title = {RefBERT: Compressing BERT by Referencing to Pre-computed Representations},
author = {Xinyi Wang and Haiqin Yang and Liang Zhao and Yang Mo and Jianping Shen},
journal= {arXiv preprint arXiv:2106.08898},
year = {2021}
}
备注
8 pages, 1 figure, 3 tables, in IJCNN'21