中文

自蒸馏量化:在基于 Transformer 的语言模型中实现高压缩率

计算与语言 2023-07-13 v1 机器学习

摘要

我们研究了训练后量化与量化感知训练对 Transformer 语言模型泛化的影响。我们提出了一种称为自蒸馏量化(SDQ)的新方法,该方法最小化累积量化误差并优于基线。我们将 SDQ 应用于多语言模型 XLM-R-Base 与 InfoXLM-Base,并证明这两个模型均可从 32 位浮点权重压缩至 8 位整型权重,同时在 XGLUE 基准上保持高水平性能。我们的结果也凸显了量化多语言模型所面临的挑战,这些模型必须泛化到未经过微调的语言。

关键词

引用

@article{arxiv.2307.05972,
  title  = {Self-Distilled Quantization: Achieving High Compression Rates in Transformer-Based Language Models},
  author = {James O' Neill and Sourav Dutta},
  journal= {arXiv preprint arXiv:2307.05972},
  year   = {2023}
}