量化感知训练、ERNIE 与峰度正则化器:一项简短的实证研究
机器学习
2021-06-29 v2 机器学习
摘要
诸如 Ernie 或 Bert 之类的预训练语言模型目前被用于许多应用中。这些模型带有一组预训练权重,通常是在海量数据上以无监督/自监督方式获得的。此后,它们在特定任务上进行微调。应用随后使用这些模型进行推理,且常常附加一些约束,例如低功耗预算或输入输出间的低延迟。在推理场景下满足这些附加要求的主要途径是使用低精度计算(例如 INT8 而非 FP32),但这会带来模型功能性能(例如准确率)下降的代价。已有一些方法被提出以解决这个问题并超越 PTO(训练后量化,Post-Training Quantization)的局限,更具体地,QAT(量化感知训练,Quantization Aware Training,见 [4])是一种干预训练过程以使训练本身受到量化阶段影响(或简单说扰动)的流程。除 QAT 外,近期 Intel-Habana Labs 提出了一种额外且更直接的方法,利用正则化器使训练结果对后续量化更具鲁棒性,从而改变了驱动训练过程的损失函数。但他们的方案并不能直接用于 Ernie 等预训练模型。在这篇短文中,我们展示了(针对 Ernie 案例)为何会出现这种情况,并提出了一种非常基础的处理方式,同时分享了一些初步结果(最终 INT8 准确率的提升),这可能会引起希望在低精度机制下于应用中使用 Ernie 的实践者的兴趣。
引用
@article{arxiv.2106.13035,
title = {Quantization Aware Training, ERNIE and Kurtosis Regularizer: a short empirical study},
author = {Andrea Zanetti},
journal= {arXiv preprint arXiv:2106.13035},
year = {2021}
}
备注
13 pages, 8 figures