中文

BiT:鲁棒二值化的多蒸馏 Transformer

机器学习 2022-10-04 v2 计算与语言

摘要

现代预训练 transformer 已迅速推进了机器学习的前沿水平,但其参数规模与计算复杂度也随之增长,使其越来越难以部署在资源受限的环境中。对网络的权重和激活进行二值化可显著缓解这些问题,然而从优化角度看这在技术上极具挑战。在本工作中,我们确定了一系列改进,使得二值化 transformer 的精度大幅高于以往可达到的水平。这些改进包括一种双集合二值化方案、一种带可学习参数的新型弹性二值激活函数,以及一种通过 successively 将高精度模型蒸馏为低精度学生模型以将网络量化至极限的方法。这些方法首次实现了具有实用精度水平的全二值化 transformer 模型,在 GLUE 语言理解基准上仅以低至 5.9% 的差距接近全精度 BERT 基线。代码与模型见:https://github.com/facebookresearch/bit。

关键词

引用

@article{arxiv.2205.13016,
  title  = {BiT: Robustly Binarized Multi-distilled Transformer},
  author = {Zechun Liu and Barlas Oguz and Aasish Pappu and Lin Xiao and Scott Yih and Meng Li and Raghuraman Krishnamoorthi and Yashar Mehdad},
  journal= {arXiv preprint arXiv:2205.13016},
  year   = {2022}
}

备注

NeurIPS 2022