中文

边际效用递减:BERT 知识蒸馏最小知识探索

计算与语言 2021-06-11 v1

摘要

近来,知识蒸馏(KD)在 BERT 压缩中取得了巨大成功。与常规 KD 中仅从教师模型的软标签学习不同,研究者发现 BERT 隐藏层中包含的丰富信息有助于学生模型的性能。为更好地利用隐藏知识,一种常见做法是强制学生模型以逐层方式深度模仿教师模型所有 token 的隐藏状态。然而在本文中,我们观察到尽管蒸馏教师的隐藏状态知识(HSK)有帮助,但随着蒸馏的 HSK 增多,性能增益(边际效用)迅速递减。为理解此效应,我们进行了一系列分析。具体而言,我们将 BERT 的 HSK 划分为深度、长度和宽度三个维度。我们首先针对每个单一维度研究提取关键知识的多种策略,进而联合压缩三个维度。由此我们表明:1) 通过提取并蒸馏关键 HSK 可提升学生模型性能;2) 使用极少量 HSK 即可达到与大量 HSK 蒸馏相同的性能。基于第二点发现,我们进一步提出了一种高效的 KD 范式来压缩 BERT,其无需在学生模型训练期间加载教师模型。对于两类学生模型与计算设备,所提 KD 范式带来了 2.7x ~ 3.4x 的训练加速。

关键词

引用

@article{arxiv.2106.05691,
  title  = {Marginal Utility Diminishes: Exploring the Minimum Knowledge for BERT Knowledge Distillation},
  author = {Yuanxin Liu and Fandong Meng and Zheng Lin and Weiping Wang and Jie Zhou},
  journal= {arXiv preprint arXiv:2106.05691},
  year   = {2021}
}

备注

Accepted by ACL 2021