中文

面向语言模型的因果蒸馏

计算与语言 2022-06-07 v2 机器学习

摘要

蒸馏研究已催生出更紧凑高效且不出现严重性能下降的语言模型。标准的蒸馏方法以两个目标训练学生模型:任务特定目标(如语言建模)以及鼓励学生模型隐藏状态与更大的教师模型隐藏状态相似的模仿目标。本文中,我们表明以第三目标增强蒸馏是有益的,该目标通过互换干预训练(IIT)鼓励学生模仿教师的因果计算过程。IIT推动学生模型成为教师模型的因果抽象——一个具有相同因果结构的更简模型。IIT完全可微、易于实现,并可与其他目标灵活组合。与BERT的标准蒸馏相比,通过IIT的蒸馏在Wikipedia(掩码语言建模)上取得更低困惑度,并在GLUE基准(自然语言理解)、SQuAD(问答)和CoNLL-2003(命名实体识别)上取得显著改进。

关键词

引用

@article{arxiv.2112.02505,
  title  = {Causal Distillation for Language Models},
  author = {Zhengxuan Wu and Atticus Geiger and Josh Rozner and Elisa Kreiss and Hanson Lu and Thomas Icard and Christopher Potts and Noah D. Goodman},
  journal= {arXiv preprint arXiv:2112.02505},
  year   = {2022}
}

备注

7 pages, 2 figures