DeeBERT:用于加速 BERT 推理的动态早退机制
计算与语言
2020-04-28 v1 机器学习
摘要
诸如 BERT 的大规模预训练语言模型为 NLP 应用带来了显著改进。然而,它们也因推理缓慢而臭名昭著,难以部署于实时应用。我们提出一种简单但有效的名为 DeeBERT 的方法来加速 BERT 推理。我们的方法允许样本无需通过整个模型即可更早退出。实验表明,DeeBERT 能够节省高达约 40% 的推理时间,且模型质量退化极小。进一步分析显示了 BERT transformer 层中的不同行为,并揭示了它们的冗余性。我们的工作为将基于深度 transformer 的模型高效应用于下游任务提供了新思路。代码见 https://github.com/castorini/DeeBERT。
引用
@article{arxiv.2004.12993,
title = {DeeBERT: Dynamic Early Exiting for Accelerating BERT Inference},
author = {Ji Xin and Raphael Tang and Jaejun Lee and Yaoliang Yu and Jimmy Lin},
journal= {arXiv preprint arXiv:2004.12993},
year = {2020}
}
备注
Accepted at ACL 2020