中文

哪个学生模型最佳?面向任务特定 BERT 模型的知识蒸馏综合评测

计算与语言 2022-01-04 v1

摘要

我们将任务特定的 BERT-base 教师模型蒸馏至各类学生模型:BiLSTM、CNN、BERT-Tiny、BERT-Mini 与 BERT-Small,并进行了知识蒸馏(KD)基准测试。我们的实验涉及按两类任务分组的 12 个数据集:印尼语文本分类与序列标注。我们还比较了蒸馏的多个方面,包括词嵌入的使用与无标签数据增强。实验表明,尽管基于 Transformer 的模型日益流行,与剪枝后的 BERT 模型相比,使用 BiLSTM 与 CNN 学生模型在性能与计算资源(CPU、RAM 与存储)之间提供了最佳权衡。我们进一步提出了一些通过高效的 KD 训练机制(涉及损失函数、词嵌入与无标签数据准备的简单选择)来执行 KD 以生成小型 NLP 模型的实用技巧。

关键词

引用

@article{arxiv.2201.00558,
  title  = {Which Student is Best? A Comprehensive Knowledge Distillation Exam for Task-Specific BERT Models},
  author = {Made Nindyatama Nityasya and Haryo Akbarianto Wibowo and Rendi Chevi and Radityo Eko Prasojo and Alham Fikri Aji},
  journal= {arXiv preprint arXiv:2201.00558},
  year   = {2022}
}

备注

14 pages, 3 figures, submitted to Elsevier