中文

BEBERT:高效且鲁棒的二值集成BERT

计算与语言 2023-05-10 v2 机器学习

摘要

预训练BERT模型在自然语言处理(NLP)任务上取得了令人印象深刻的准确率。然而,其过量的参数阻碍了在边缘设备上的高效部署。BERT模型的二值化可显著缓解该问题,但与全精度对应模型相比会带来严重的准确率下降。本文中,我们提出一种高效且鲁棒的二值集成BERT(BEBERT)来弥合准确率差距。据我们所知,这是首项在二值BERT上运用集成技术的工作,由此产生BEBERT,其在保持计算效率的同时实现了优越准确率。此外,我们在集成过程中去除了知识蒸馏步骤,以在不牺牲准确率的前提下加速训练过程。GLUE基准上的实验结果表明,所提BEBERT在准确率和鲁棒性上显著优于现有二值BERT模型,且训练时间提速2倍。而且,与全精度基线相比,我们的BEBERT仅有0.3%的微小准确率损失,同时在FLOPs和模型大小上分别节省15倍和13倍。此外,BEBERT在准确率上还以最高6.7%的优势超越其他压缩BERT。

关键词

引用

@article{arxiv.2210.15976,
  title  = {BEBERT: Efficient and Robust Binary Ensemble BERT},
  author = {Jiayi Tian and Chao Fang and Haonan Wang and Zhongfeng Wang},
  journal= {arXiv preprint arXiv:2210.15976},
  year   = {2023}
}

备注

To appear in 2023 IEEE International Conference on Acoustics, Speech, and Signal Processing (ICASSP 2023)