利用层映射搜索改进任务无关的 BERT 蒸馏
计算与语言
2020-12-14 v1
摘要
知识蒸馏(KD)将大模型(教师模型)的知识迁移到小模型(学生模型),近年来被广泛用于压缩 BERT 模型。除了原始 KD 中对输出的监督外,近期工作表明层级别监督对学生 BERT 模型的性能至关重要。然而,以往工作启发式地设计层映射策略(例如均匀映射或最后一层映射),这可能导致较差的性能。本文提出使用遗传算法(GA)自动搜索最优层映射。为加速搜索过程,我们进一步提出一种代理设置:采样一小部分训练语料进行蒸馏,并选择三个代表性任务用于评估。获得最优层映射后,我们在完整语料上以其执行任务无关的 BERT 蒸馏,构建紧凑的学生模型,该模型可直接在下游任务上微调。在评估基准上的综合实验表明:1)层映射策略对任务无关的 BERT 蒸馏有显著影响,不同层映射会导致差异很大的性能;2)所提搜索过程得到的最优层映射策略始终优于其他启发式策略;3)借助最优层映射,我们的学生模型在 GLUE 任务上取得了最先进的性能。
引用
@article{arxiv.2012.06153,
title = {Improving Task-Agnostic BERT Distillation with Layer Mapping Search},
author = {Xiaoqi Jiao and Huating Chang and Yichun Yin and Lifeng Shang and Xin Jiang and Xiao Chen and Linlin Li and Fang Wang and Qun Liu},
journal= {arXiv preprint arXiv:2012.06153},
year = {2020}
}