中文

面向预训练Transformer的极简高效极限压缩

计算与语言 2022-06-07 v1 机器学习

摘要

极限压缩,特别是超低比特精度(二值/三值)量化,已被提出用于将大型 NLP 模型部署到资源受限设备上。然而,为了在这种激进的压缩方案下保持精度,前沿方法通常引入复杂的压缩流程,例如多阶段昂贵的知识蒸馏与大量的超参数调优。此外,它们往往较少关注已经通过知识蒸馏被重度压缩的较小 transformer 模型,并缺乏系统性研究来展示其方法的有效性。在本文中,我们进行了非常全面的系统性研究,以衡量先前工作中许多关键超参数和训练策略的影响。结果我们发现,先前用于超低比特精度量化的基线显著欠训练。基于我们的研究,我们提出了一种简单而有效的极限压缩流程,称为 XTC。XTC 表明:(1)我们可以跳过预训练知识蒸馏来获得一个 5 层 BERT,同时取得比先前 SOTA 方法(如 6 层 TinyBERT)更好的性能;(2)极限量化加层数缩减能够将模型大小压缩 50 倍,从而在 GLUE 任务上取得新的 SOTA 结果。

关键词

引用

@article{arxiv.2206.01859,
  title  = {Extreme Compression for Pre-trained Transformers Made Simple and Efficient},
  author = {Xiaoxia Wu and Zhewei Yao and Minjia Zhang and Conglong Li and Yuxiong He},
  journal= {arXiv preprint arXiv:2206.01859},
  year   = {2022}
}

备注

10 pages, 4 figures