面向 Transformer 推理的零样本动态量化
计算与语言
2022-11-18 v1
摘要
我们引入一种新颖的运行时方法,用于显著减少将 BERT 类模型量化为 8 位整数所带来的精度损失。现有的模型量化方法要么修改训练过程,要么需要额外的校准步骤来调整参数,且同样需要一个选定的留出数据集。我们的方法无需这些调整即可利用量化优势。我们展示了在若干 NLP 任务上的结果,证明了该技术的实用性。
引用
@article{arxiv.2211.09744,
title = {Zero-Shot Dynamic Quantization for Transformer Inference},
author = {Yousef El-Kurdi and Jerry Quinn and Avirup Sil},
journal= {arXiv preprint arXiv:2211.09744},
year = {2022}
}
备注
To appear in EMNLP 2022 industry track