Q-BERT:基于 Hessian 的 BERT 超低精度量化
计算与语言
2021-04-21 v2 机器学习
摘要
基于 Transformer 的架构已成为一系列自然语言处理任务的事实标准模型。特别是,基于 BERT 的模型在 GLUE 任务、CoNLL-03 和 SQuAD 上取得了显著的准确率提升。然而,基于 BERT 的模型具有令人望而却步的内存占用与延迟。因此,在资源受限环境中部署基于 BERT 的模型已成为一项具有挑战性的任务。在本工作中,我们利用二阶 Hessian 信息对微调后的 BERT 模型进行了广泛分析,并基于分析结果提出了一种将 BERT 模型量化为超低精度的新方法。具体而言,我们提出了一种新的分组量化方案,并利用基于 Hessian 的混合精度方法进一步压缩模型。我们在 SST-2、MNLI、CoNLL-03 和 SQuAD 等 BERT 下游任务上对我们的方法进行了充分测试。即使采用低至 2 比特的超低精度量化,我们也能以至多 的性能下降达到与基线相当的性能,对应模型参数至多 的压缩、嵌入表以及激活值至多 的压缩。在所有任务中,我们观察到在 SQuAD 上微调的 BERT 性能损失最高。通过深入 Hessian 基分析与可视化,我们表明这与当前 BERT 的训练/微调策略在 SQuAD 上未收敛的事实有关。
引用
@article{arxiv.1909.05840,
title = {Q-BERT: Hessian Based Ultra Low Precision Quantization of BERT},
author = {Sheng Shen and Zhen Dong and Jiayu Ye and Linjian Ma and Zhewei Yao and Amir Gholami and Michael W. Mahoney and Kurt Keutzer},
journal= {arXiv preprint arXiv:1909.05840},
year = {2021}
}