先提取再蒸馏:高效且有效的任务无关 BERT 蒸馏
计算与语言
2021-04-27 v1
摘要
任务无关知识蒸馏作为一种师生框架,已被证明对 BERT 压缩有效。尽管在 NLP 任务上取得了有前景的结果,它需要巨大的计算资源。本文中,我们提出 Extract Then Distill(ETD),一种通用且灵活的策略,复用教师参数以实现高效且有效的任务无关蒸馏,可应用于任意大小的 student。具体地,我们引入 ETD 的两种变体,ETD-Rand 和 ETD-Impt,分别以随机方式和遵循重要性度量来提取教师参数。这样,student 在蒸馏过程开始时已获取部分知识,使蒸馏过程收敛更快。我们在 GLUE 基准和 SQuAD 上展示了 ETD 的有效性。实验结果表明:(1)与无 ETD 策略的基线相比,ETD 可节省 70% 的计算成本;且在使用相同计算资源时取得优于基线的结果。(2)ETD 是通用的,已证明对不同蒸馏方法(如 TinyBERT 和 MiniLM)和不同大小的 student 均有效。源代码将在发表后公开。
引用
@article{arxiv.2104.11928,
title = {Extract then Distill: Efficient and Effective Task-Agnostic BERT Distillation},
author = {Cheng Chen and Yichun Yin and Lifeng Shang and Zhi Wang and Xin Jiang and Xiao Chen and Qun Liu},
journal= {arXiv preprint arXiv:2104.11928},
year = {2021}
}