BERT 的自动混合精度量化搜索
计算与语言
2022-01-03 v1 人工智能
摘要
诸如 BERT 之类的预训练语言模型在各种自然语言处理任务中展现出显著效果。然而,这些模型通常包含数百万参数,阻碍了它们在资源受限设备上的实际部署。知识蒸馏、权重剪枝和量化被认为是模型压缩的主要方向。然而,通过知识蒸馏获得的紧凑模型即使在相对较小的压缩比下也可能遭受显著的精度下降。另一方面,专门为自然语言处理任务设计的量化尝试很少。它们由于需要手动设置超参数且不支持细粒度子组级量化,而面临压缩比小或错误率大的问题。在本文中,我们提出了一种为 BERT 设计的自动混合精度量化框架,能够在子组级别同时执行量化和剪枝。具体而言,我们提出的方法利用可微神经架构搜索(Differentiable Neural Architecture Search)自动为每个子组中的参数分配尺度和精度,同时剪枝掉冗余的参数组。在 BERT 下游任务上的大量评估表明,我们提出的方法以小得多的模型尺寸提供了与基线相同的性能,从而优于基线。我们还展示了通过将我们的方案与 DistilBERT 等正交方法结合来获得极轻量模型的可行性。
引用
@article{arxiv.2112.14938,
title = {Automatic Mixed-Precision Quantization Search of BERT},
author = {Changsheng Zhao and Ting Hua and Yilin Shen and Qian Lou and Hongxia Jin},
journal= {arXiv preprint arXiv:2112.14938},
year = {2022}
}