中文

TangoBERT:通过级联架构降低推理成本

计算与语言 2022-04-14 v1 人工智能

摘要

诸如BERT、RoBERTa和XLNet等基于大型transformer的模型在许多NLP任务中取得了显著成功,但由于其高计算负载和能耗,带来了货币与环境成本的大幅增加。为了在推理时间降低此计算负载,我们提出TangoBERT,一种级联模型架构,其中实例首先由高效但准确性较低的第一层模型处理,仅其中部分实例被准确性较高但效率较低的第二层模型额外处理。是否应用第二层模型的决策基于第一层模型产生的置信度分数。与基于多层transformer模型的标准级联方法相比,我们的简单方法具有若干吸引人的实际优势。首先,它可实现更高的加速收益(平均更低延迟)。其次,它利用批大小优化用于级联,从而增加了相对的推理成本降低。我们报告了TangoBERT在四个文本分类GLUE任务和一个阅读理解任务上的CPU推理加速。实验结果表明TangoBERT优于高效的早退基线模型;在SST-2任务上,其以8.2倍CPU加速实现了93.9%的准确率。

关键词

引用

@article{arxiv.2204.06271,
  title  = {TangoBERT: Reducing Inference Cost by using Cascaded Architecture},
  author = {Jonathan Mamou and Oren Pereg and Moshe Wasserblat and Roy Schwartz},
  journal= {arXiv preprint arXiv:2204.06271},
  year   = {2022}
}