如何蒸馏你的 BERT:权重初始化与蒸馏目标影响的实证研究
计算与语言
2023-05-25 v1 人工智能
机器学习
摘要
最近,各种中间层蒸馏(ILD)目标已被证明可通过知识蒸馏(KD)改善 BERT 模型的压缩。然而,在任务特定和任务无关两种设置下对这些目标进行全面评估尚显不足。据我们所知,这是第一项在两种设置下全面评估蒸馏目标的工作。我们表明注意力迁移总体上给出最佳性能。我们还研究了从教师层初始化学生时层选择的影响,发现其在任务特定蒸馏中对性能有显著影响。对于普通 KD 和隐藏状态迁移,使用教师较低层初始化比较高层有可观改进,尤其在 QNLI 任务上(准确率绝对百分比变化高达 17.8)。注意力迁移在不同初始化设置下表现一致。我们发布代码作为一个高效的基于 Transformer 的模型蒸馏框架以供进一步研究。
引用
@article{arxiv.2305.15032,
title = {How to Distill your BERT: An Empirical Study on the Impact of Weight Initialisation and Distillation Objectives},
author = {Xinpeng Wang and Leonie Weissweiler and Hinrich Schütze and Barbara Plank},
journal= {arXiv preprint arXiv:2305.15032},
year = {2023}
}
备注
ACL 2023