LadaBERT:通过混合模型压缩对BERT进行轻量化适配
计算与语言
2020-10-22 v2 机器学习
摘要
BERT是一种通过在大型语料库上预训练得到的尖端语言表示模型,在各种自然语言理解任务上取得了优越性能。然而,将BERT应用于在线服务的一个主要障碍是它内存密集,并导致用户请求延迟不理想,从而产生了模型压缩的必要性。现有解决方案利用知识蒸馏框架来学习一个模仿BERT行为的小模型。然而,知识蒸馏的训练过程本身开销很大,因为它需要充足的训练数据来模仿教师模型。在本文中,我们通过提出一种名为LadaBERT(通过混合模型压缩对BERT进行轻量化适配)的混合解决方案来解决此问题,该方案结合了不同模型压缩方法的优势,包括权重剪枝、矩阵分解和知识蒸馏。LadaBERT在各种公开数据集上达到了最先进的准确率,同时训练开销可降低一个数量级。
引用
@article{arxiv.2004.04124,
title = {LadaBERT: Lightweight Adaptation of BERT through Hybrid Model Compression},
author = {Yihuan Mao and Yujing Wang and Chufan Wu and Chen Zhang and Yang Wang and Yaming Yang and Quanlu Zhang and Yunhai Tong and Jing Bai},
journal= {arXiv preprint arXiv:2004.04124},
year = {2020}
}
备注
COLING2020