中文

ERNIE 3.0 Tiny:一种极其简单的提升任务无关蒸馏泛化能力的方法

计算与语言 2023-01-10 v1

摘要

任务无关知识蒸馏试图通过在资源受限场景中压缩称为教师的大规模预训练语言模型为称为学生的更小模型来解决部署问题,使得学生可直接在下游任务上微调并保留可比性能。然而,我们经验性地发现现有方法中学生与教师之间存在泛化差距。在这项工作中,我们展示可在任务无关蒸馏中利用多任务学习来提升所得学生的泛化能力。具体而言,我们提出多任务注入式任务无关知识蒸馏(MITKD)。我们首先通过在多个下游任务上多任务训练来增强教师,然后执行蒸馏以产出学生。实验结果表明,我们的方法产出的学生具有好得多的泛化能力,显著优于现有基线,并在任务无关蒸馏设定下在域内、域外和低资源数据集上确立了新的最先进结果。此外,我们的方法甚至在SQuAD和四项GLUE任务上超过了大8倍的BERTBase_{\text{Base}}。另外,通过结合ERNIE 3.0,我们的方法在10个中文数据集上取得了最先进结果。

关键词

引用

@article{arxiv.2301.03416,
  title  = {ERNIE 3.0 Tiny: Frustratingly Simple Method to Improve Task-Agnostic Distillation Generalization},
  author = {Weixin Liu and Xuyi Chen and Jiaxiang Liu and Shikun Feng and Yu Sun and Hao Tian and Hua Wu},
  journal= {arXiv preprint arXiv:2301.03416},
  year   = {2023}
}