自蒸馏量化:在基于 Transformer 的语言模型中实现高压缩率
计算与语言
2023-07-13 v1 机器学习
摘要
我们研究了训练后量化与量化感知训练对 Transformer 语言模型泛化的影响。我们提出了一种称为自蒸馏量化(SDQ)的新方法,该方法最小化累积量化误差并优于基线。我们将 SDQ 应用于多语言模型 XLM-R-Base 与 InfoXLM-Base,并证明这两个模型均可从 32 位浮点权重压缩至 8 位整型权重,同时在 XGLUE 基准上保持高水平性能。我们的结果也凸显了量化多语言模型所面临的挑战,这些模型必须泛化到未经过微调的语言。
引用
@article{arxiv.2307.05972,
title = {Self-Distilled Quantization: Achieving High Compression Rates in Transformer-Based Language Models},
author = {James O' Neill and Sourav Dutta},
journal= {arXiv preprint arXiv:2307.05972},
year = {2023}
}