中文

面向数据稀缺领域 BERT 知识蒸馏的学习式增强方法

计算与语言 2021-06-22 v2

摘要

尽管诸如 BERT 之类的预训练语言模型已在广泛的自然语言处理任务中取得引人注目的性能,但它们在计算上过于昂贵,难以部署于实时应用中。一种典型方法是采用知识蒸馏将这些大型预训练模型(教师模型)压缩为小型学生模型。然而,对于训练数据稀缺的目标领域,教师模型难以向学生传递有用知识,导致学生模型性能下降。为解决此问题,我们提出一种面向数据稀缺领域 BERT 知识蒸馏的学习式增强方法,通过学习一种跨领域操作方案,在资源丰富的源领域帮助下自动增强目标领域。具体而言,所提方法生成从目标数据附近的平稳分布中获取的样本,并采用强化选择器根据学生的性能自动优化增强策略。大量实验表明,所提方法在四个不同任务上显著优于最先进的基线,并且对于数据稀缺领域,压缩后的学生模型甚至优于原始大型教师模型,在仅少量标注样本可用时参数量仅为其 13.3%{\sim}13.3\%

关键词

引用

@article{arxiv.2101.08106,
  title  = {Learning to Augment for Data-Scarce Domain BERT Knowledge Distillation},
  author = {Lingyun Feng and Minghui Qiu and Yaliang Li and Hai-Tao Zheng and Ying Shen},
  journal= {arXiv preprint arXiv:2101.08106},
  year   = {2021}
}

备注

AAAI2021