中文

面向 Web 问答系统的两阶段多教师知识蒸馏模型压缩方法

计算与语言 2019-10-21 v1

摘要

深度预训练与微调模型(如 BERT 和 OpenAI GPT)在问答领域已展现出优异的效果。然而,由于模型参数量巨大,这些模型的推理速度非常慢。如何将这些复杂模型应用于真实业务场景成为一个具有挑战性但实用的问题。以往的模型压缩方法通常在压缩过程中存在信息损失,导致压缩后的模型劣于原始模型。为应对这一挑战,我们提出了一种面向 Web 问答系统的两阶段多教师知识蒸馏(简称 TMKD)方法。我们首先为学生模型预训练开发一个通用的问答蒸馏任务,并在下游任务(如 Web 问答任务、来自 GLUE 的 MNLI、SNLI、RTE 任务)上通过多教师知识蒸馏进一步微调该预训练学生模型,这有效降低了单个教师模型中的过拟合偏差,并向学生模型迁移了更通用的知识。实验结果表明,我们的方法能显著优于基线方法,甚至取得与原始教师模型相当的结果,同时大幅加快了模型推理速度。

关键词

引用

@article{arxiv.1910.08381,
  title  = {Model Compression with Two-stage Multi-teacher Knowledge Distillation for Web Question Answering System},
  author = {Ze Yang and Linjun Shou and Ming Gong and Wutao Lin and Daxin Jiang},
  journal= {arXiv preprint arXiv:1910.08381},
  year   = {2019}
}

备注

Accepted by WSDM 2020