BiBERT:精确的完全二值化BERT
计算与语言
2022-03-15 v1
摘要
大型预训练BERT在自然语言处理(NLP)任务上取得了卓越性能,但也带来了计算与内存开销。作为强有力的压缩方法之一,二值化通过利用1-bit参数与按位运算极大地降低了计算与内存消耗。遗憾的是,BERT的完全二值化(即1-bit权重、嵌入与激活)通常遭遇显著的性能下降,且鲜有研究解决该问题。本文中,通过理论论证与实证分析,我们确认严重的性能下降主要分别归因于前向与反向传播中的信息退化与优化方向失配,并提出BiBERT,一种精确的完全二值化BERT,以消除性能瓶颈。具体而言,BiBERT引入高效的Bi-Attention结构以统计上最大化表示信息,以及方向匹配蒸馏(DMD)方案以精确优化完全二值化BERT。大量实验表明,在NLP基准上,BiBERT以令人信服的幅度优于直接基线及现有具有超低比特激活的先进量化BERT。作为首个完全二值化BERT,我们的方法在FLOPs与模型尺寸上分别实现56.3倍与31.2倍的节省,展示了完全二值化BERT模型在真实资源受限场景中的巨大优势与潜力。
引用
@article{arxiv.2203.06390,
title = {BiBERT: Accurate Fully Binarized BERT},
author = {Haotong Qin and Yifu Ding and Mingyuan Zhang and Qinghua Yan and Aishan Liu and Qingqing Dang and Ziwei Liu and Xianglong Liu},
journal= {arXiv preprint arXiv:2203.06390},
year = {2022}
}