中文

CascadeBERT:通过校准的完整模型级联加速预训练语言模型推理

计算与语言 2021-09-06 v2

摘要

动态早退出旨在通过内部层发出预测而不经过整个模型来加速预训练语言模型(PLMs)的推理。在本文中,我们实证分析了动态早退出的工作机制,发现其在高加速比下面临性能瓶颈。一方面,PLMs在浅层的表示缺乏高级语义信息,因此不足以进行准确预测。另一方面,内部分类器做出的退出决策不可靠,导致错误发出的早预测。我们转而提出一种加速PLMs推理的新框架CascadeBERT,它以级联方式动态选择合适的尺寸和完整模型,为预测提供全面的表示。我们进一步设计了一个难度感知目标,鼓励模型输出反映每个实例真实难度的类概率,以实现更可靠的级联机制。实验结果表明,在六个分类任务上,与现有动态早退出方法相比,CascadeBERT在4倍加速下可实现总体15%的提升,产生更校准和准确的预测。

关键词

引用

@article{arxiv.2012.14682,
  title  = {CascadeBERT: Accelerating Inference of Pre-trained Language Models via Calibrated Complete Models Cascade},
  author = {Lei Li and Yankai Lin and Deli Chen and Shuhuai Ren and Peng Li and Jie Zhou and Xu Sun},
  journal= {arXiv preprint arXiv:2012.14682},
  year   = {2021}
}

备注

Findings of EMNLP 2021