中文

利用层映射搜索改进任务无关的 BERT 蒸馏

计算与语言 2020-12-14 v1

摘要

知识蒸馏(KD)将大模型(教师模型)的知识迁移到小模型(学生模型),近年来被广泛用于压缩 BERT 模型。除了原始 KD 中对输出的监督外,近期工作表明层级别监督对学生 BERT 模型的性能至关重要。然而,以往工作启发式地设计层映射策略(例如均匀映射或最后一层映射),这可能导致较差的性能。本文提出使用遗传算法(GA)自动搜索最优层映射。为加速搜索过程,我们进一步提出一种代理设置:采样一小部分训练语料进行蒸馏,并选择三个代表性任务用于评估。获得最优层映射后,我们在完整语料上以其执行任务无关的 BERT 蒸馏,构建紧凑的学生模型,该模型可直接在下游任务上微调。在评估基准上的综合实验表明:1)层映射策略对任务无关的 BERT 蒸馏有显著影响,不同层映射会导致差异很大的性能;2)所提搜索过程得到的最优层映射策略始终优于其他启发式策略;3)借助最优层映射,我们的学生模型在 GLUE 任务上取得了最先进的性能。

关键词

引用

@article{arxiv.2012.06153,
  title  = {Improving Task-Agnostic BERT Distillation with Layer Mapping Search},
  author = {Xiaoqi Jiao and Huating Chang and Yichun Yin and Lifeng Shang and Xin Jiang and Xiao Chen and Linlin Li and Fang Wang and Qun Liu},
  journal= {arXiv preprint arXiv:2012.06153},
  year   = {2020}
}