QuaLA-MiniLM:一种量化长度自适应MiniLM
计算与语言
2023-05-11 v3
摘要
有限的计算预算常常阻碍transformer在生产环境中的应用及其高精度的发挥。一种知识蒸馏方法通过将BERT自蒸馏为层数更少、内部嵌入更小的较小transformer表征来解决计算效率问题。然而,随着层数减少,这些模型的性能会下降,尤其在跨度问答等高级NLP任务中。此外,必须为每个具有不同计算预算的推理场景分别训练模型。Dynamic-TinyBERT通过将长度自适应Transformer(LAT)技术部分实现于TinyBERT上解决了这两大局限,相较BERT-base实现了x3加速且精度损失极小。本工作中,我们拓展Dynamic-TinyBERT方法以生成效率更高的模型。我们将MiniLM蒸馏与LAT方法联合使用,并进一步通过低比特量化提升效率。我们的量化长度自适应MiniLM模型(QuaLA-MiniLM)仅训练一次,可动态适配任意推理场景,并在SQuAD1.1数据集上以任意计算预算均实现了优于其他任何高效方法的精度-效率折中(最高x8.8加速且精度损失<1%)。复现本工作的代码已公开于Github。
引用
@article{arxiv.2210.17114,
title = {QuaLA-MiniLM: a Quantized Length Adaptive MiniLM},
author = {Shira Guskin and Moshe Wasserblat and Chang Wang and Haihao Shen},
journal= {arXiv preprint arXiv:2210.17114},
year = {2023}
}
备注
In this version we updated the reference to the source code in the abstract. arXiv admin note: text overlap with arXiv:2111.09645