TernaryBERT:感知量化的超低比特 BERT
计算与语言
2020-10-13 v3 机器学习
声音
音频与语音处理
摘要
基于 Transformer 的预训练模型如 BERT 已在许多自然语言处理任务中取得显著性能。然而,这些模型在计算和内存上均开销巨大,阻碍了其向资源受限设备的部署。本工作中,我们提出 TernaryBERT,其对微调后的 BERT 模型中的权重进行三值化。具体而言,我们采用基于近似与感知损失的三值化方法,并实证考察 BERT 不同部分的三值化粒度。此外,为降低低比特较低容量引起的精度退化,我们在训练过程中利用了知识蒸馏技术。在 GLUE 基准与 SQuAD 上的实验表明,我们提出的 TernaryBERT 优于其他 BERT 量化方法,甚至在与全精度模型性能相当的同时体积小 14.9 倍。
引用
@article{arxiv.2009.12812,
title = {TernaryBERT: Distillation-aware Ultra-low Bit BERT},
author = {Wei Zhang and Lu Hou and Yichun Yin and Lifeng Shang and Xiao Chen and Xin Jiang and Qun Liu},
journal= {arXiv preprint arXiv:2009.12812},
year = {2020}
}
备注
Accepted by EMNLP 2020