ERNIE-Tiny:一种用于预训练Transformer压缩的渐进式蒸馏框架
计算与语言
2021-06-07 v1
摘要
BERT等预训练语言模型(PLMs)采用先在通用数据上预训练、再在任务特定数据上微调的训练范式,近期取得了巨大成功。然而,PLMs因其参数量巨大而声名狼藉,难以部署于实际应用。知识蒸馏通过将知识从大型教师模型迁移到更小的学生模型,已成为解决该问题的主流方法。我们认为教师模型、训练数据和学习目标这三个关键组件的选择对蒸馏效果至关重要。因此,我们提出了一个四阶段渐进式蒸馏框架ERNIE-Tiny来压缩PLM,该框架使这三个组件从通用层面逐步过渡到任务特定层面。具体而言,第一阶段通用蒸馏(General Distillation)在预训练教师模型、通用数据和隐蒸馏损失的指导下进行蒸馏;随后,通用增强蒸馏(General-Enhanced Distillation)将教师模型从预训练教师替换为微调后教师;之后,任务自适应蒸馏(Task-Adaptive Distillation)将训练数据从通用数据转为任务特定数据;最后,任务特定蒸馏(Task-Specific Distillation)在上一阶段基础上增加软标签(Soft-Label)和硬标签(Hard-Label)两个额外损失。实证结果证明了我们框架的有效性以及ERNIE-Tiny带来的泛化提升。特别地,实验表明一个4层的ERNIE-Tiny在GLUE基准上保持了其12层教师模型BERT base超过98.0%的性能,在以相同参数量超越当前最优(SOTA)1.0% GLUE分数的同时,且在五个中文NLP任务上取得了新的压缩SOTA,以少7.5倍参数和快9.4倍推理速度超越BERT base 0.4%准确率。
引用
@article{arxiv.2106.02241,
title = {ERNIE-Tiny : A Progressive Distillation Framework for Pretrained Transformer Compression},
author = {Weiyue Su and Xuyi Chen and Shikun Feng and Jiaxiang Liu and Weixin Liu and Yu Sun and Hao Tian and Hua Wu and Haifeng Wang},
journal= {arXiv preprint arXiv:2106.02241},
year = {2021}
}