中文

面向语言任务的后训练量化方法的实证评估

计算与语言 2022-11-01 v1

摘要

基于 Transformer 的架构如 BERT 在广泛的自然语言任务中取得了巨大成功。尽管性能可观,这些模型仍具有大量参数和高计算复杂度,阻碍其在资源受限环境中的部署。后训练量化(Post-Training Quantization, PTQ)能够在无需额外训练的情况下实现低比特计算,是一种有前景的工具。在本工作中,我们对 BERT-Base 和 BERT-Large 上的三种 PTQ 方法进行了实证评估:线性量化(Linear Quantization, LQ)、用于整数量化的解析截断(Analytical Clipping for Integer Quantization, ACIQ)和离群通道分割(Outlier Channel Splitting, OCS)。OCS 在理论上优于其他方法,能够最小化均方量化误差(Mean Square quantization Error)并避免扭曲权重的离群值。这与 GLUE 基准的大多数语言任务以及阅读理解任务 SQuAD 的评估结果一致。此外,低比特量化的 BERT 模型在若干小型语言任务上可以超越相应的 32 位基线,我们将其归因于过参数化的缓解。我们进一步探索了量化比特的极限,表明 OCS 可将 BERT-Base 和 BERT-Large 量化为 3 比特,并分别在 GLUE 基准上保留 98% 和 96% 的性能。此外,我们对整个 BERT 系列(即不同配置的 BERT 模型)进行量化,并在 GLUE 基准和 SQuAD 上全面评估其性能,希望为它们在各种计算环境中的部署提供有价值的指导。

关键词

引用

@article{arxiv.2210.16621,
  title  = {Empirical Evaluation of Post-Training Quantization Methods for Language Tasks},
  author = {Ting Hu and Christoph Meinel and Haojin Yang},
  journal= {arXiv preprint arXiv:2210.16621},
  year   = {2022}
}