LightPAFF:一种用于预训练与微调的两阶段蒸馏框架
计算与语言
2020-04-28 v1 机器学习
摘要
尽管预训练与微调(例如 BERT、GPT-2)已在语言理解与生成任务中取得巨大成功,但预训练模型通常在内存开销与推理速度方面过于庞大,难以用于线上部署,这阻碍了它们在实际线上的使用。本文提出 LightPAFF,一种轻量级预训练与微调框架(Lightweight Pre-training And Fine-tuning Framework),利用两阶段知识蒸馏,在预训练与微调两个阶段将知识从大型教师模型迁移到轻量级学生模型。由此轻量级模型可达到与大型教师模型相近的精度,但参数量大幅减少,从而线上推理速度更快。LightPAFF 可支持不同的预训练方法(如 BERT、GPT-2 与 MASS)并应用于众多下游任务。在三个语言理解任务、三个语言建模任务与三个序列到序列生成任务上的实验表明,LightPAFF 在取得与大型 BERT、GPT-2 和 MASS 模型相近精度的同时,将模型规模缩减近 5 倍,并将线上推理速度提升 5 至 7 倍。
引用
@article{arxiv.2004.12817,
title = {LightPAFF: A Two-Stage Distillation Framework for Pre-training and Fine-tuning},
author = {Kaitao Song and Hao Sun and Xu Tan and Tao Qin and Jianfeng Lu and Hongzhi Liu and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2004.12817},
year = {2020}
}