KDLSQ-BERT:结合知识蒸馏与学习步长量化的BERT量化方法
计算与语言
2021-01-18 v1 人工智能
机器学习
摘要
近来,诸如 BERT 等基于 transformer 的语言模型在自然语言处理一系列任务上展现出巨大的性能提升。然而,这些语言模型在推理时通常计算昂贵且内存密集,因此难以部署在资源受限设备上。为提升推理性能,并在保持模型精度的同时减小模型规模,我们提出一种名为 KDLSQ-BERT 的新型量化方法,将知识蒸馏(KD)与学习步长量化(LSQ)结合用于语言模型量化。我们方法的核心思想是:在利用 LSQ 量化“学生”模型的量化训练过程中,借助 KD 技术将“教师”模型的知识迁移至该“学生”模型。在 GLUE 基准与 SQuAD 上的大量实验结果表明,我们所提 KDLSQ-BERT 不仅在不同比特(如 2-bit 8-bit)量化时表现有效,而且优于现有 BERT 量化方法,甚至在获得 14.9x 压缩比的同时达到与全精度基线模型相当的性能。我们的代码将公开可用。
引用
@article{arxiv.2101.05938,
title = {KDLSQ-BERT: A Quantized Bert Combining Knowledge Distillation with Learned Step Size Quantization},
author = {Jing Jin and Cai Liang and Tiancheng Wu and Liqin Zou and Zhiliang Gan},
journal= {arXiv preprint arXiv:2101.05938},
year = {2021}
}