Dynamic-TinyBERT:通过动态序列长度提升TinyBERT的推理效率
计算与语言
2021-11-19 v1 机器学习
摘要
有限的计算预算常常阻碍transformer在生产环境中的应用,使其高精度无法被利用。TinyBERT通过将BERT自蒸馏为层数更少、内部嵌入更小的较小transformer表征来解决计算效率问题。然而,当我们将层数减少50%时,TinyBERT性能下降;对于跨度问答等高级NLP任务,当层数减少75%时性能下降更为急剧。此外,必须为每个具有不同计算预算的推理场景分别训练模型。本工作中,我们提出Dynamic-TinyBERT,一种利用序列长度缩减与超参数优化以提升任意计算预算下推理效率的TinyBERT模型。Dynamic-TinyBERT仅训练一次,性能与BERT相当,并实现了优于其他任何高效方法的精度-加速权衡(最高3.3倍且精度损失<1%)。发布时,复现本工作的代码将开源。
引用
@article{arxiv.2111.09645,
title = {Dynamic-TinyBERT: Boost TinyBERT's Inference Efficiency by Dynamic Sequence Length},
author = {Shira Guskin and Moshe Wasserblat and Ke Ding and Gyuwan Kim},
journal= {arXiv preprint arXiv:2111.09645},
year = {2021}
}
备注
ENLSP NeurIPS Workshop 2021, 7 pages