中文

面向 Transformer 推理的零样本动态量化

计算与语言 2022-11-18 v1

摘要

我们引入一种新颖的运行时方法,用于显著减少将 BERT 类模型量化为 8 位整数所带来的精度损失。现有的模型量化方法要么修改训练过程,要么需要额外的校准步骤来调整参数,且同样需要一个选定的留出数据集。我们的方法无需这些调整即可利用量化优势。我们展示了在若干 NLP 任务上的结果,证明了该技术的实用性。

关键词

引用

@article{arxiv.2211.09744,
  title  = {Zero-Shot Dynamic Quantization for Transformer Inference},
  author = {Yousef El-Kurdi and Jerry Quinn and Avirup Sil},
  journal= {arXiv preprint arXiv:2211.09744},
  year   = {2022}
}

备注

To appear in EMNLP 2022 industry track