PoWER-BERT:通过渐进式词向量消除加速 BERT 推理
机器学习
2020-09-09 v5 计算与语言
机器学习
摘要
我们提出了一种称为 PoWER-BERT 的新方法,用于在保持精度的同时改善流行模型 BERT 的推理时间。其工作原理为:a) 利用与词向量(中间编码器输出)相关的冗余并消除冗余向量。b) 基于自注意力机制开发一种衡量词向量重要性的策略,以确定消除哪些词向量。c) 通过扩充 BERT 模型和损失函数来学习应消除多少个词向量。在标准 GLUE 基准上的实验表明,PoWER-BERT 相较于 BERT 实现了高达 4.5 倍的推理时间缩减,且精度损失小于 1%。我们展示 PoWER-BERT 相比先前方法在精度与推理时间之间提供了显著更优的权衡。我们证明,当应用于高度压缩版 BERT(即 ALBERT)时,我们的方法实现了高达 6.8 倍的推理时间缩减,且精度损失小于 1%。PoWER-BERT 的代码公开于 https://github.com/IBM/PoWER-BERT。
引用
@article{arxiv.2001.08950,
title = {PoWER-BERT: Accelerating BERT Inference via Progressive Word-vector Elimination},
author = {Saurabh Goyal and Anamitra R. Choudhury and Saurabh M. Raje and Venkatesan T. Chakaravarthy and Yogish Sabharwal and Ashish Verma},
journal= {arXiv preprint arXiv:2001.08950},
year = {2020}
}
备注
Accepted at ICML 2020