中文

DeeBERT:用于加速 BERT 推理的动态早退机制

计算与语言 2020-04-28 v1 机器学习

摘要

诸如 BERT 的大规模预训练语言模型为 NLP 应用带来了显著改进。然而,它们也因推理缓慢而臭名昭著,难以部署于实时应用。我们提出一种简单但有效的名为 DeeBERT 的方法来加速 BERT 推理。我们的方法允许样本无需通过整个模型即可更早退出。实验表明,DeeBERT 能够节省高达约 40% 的推理时间,且模型质量退化极小。进一步分析显示了 BERT transformer 层中的不同行为,并揭示了它们的冗余性。我们的工作为将基于深度 transformer 的模型高效应用于下游任务提供了新思路。代码见 https://github.com/castorini/DeeBERT。

关键词

引用

@article{arxiv.2004.12993,
  title  = {DeeBERT: Dynamic Early Exiting for Accelerating BERT Inference},
  author = {Ji Xin and Raphael Tang and Jaejun Lee and Yaoliang Yu and Jimmy Lin},
  journal= {arXiv preprint arXiv:2004.12993},
  year   = {2020}
}

备注

Accepted at ACL 2020