ROSITA:基于集成技术的精炼 BERT 压缩方法
计算与语言
2021-03-23 v1
摘要
BERT 系列预训练语言模型在广泛的 NLP 任务中确立了最先进的性能。然而,基于 BERT 的模型的性能主要由海量参数驱动,这阻碍了它们在资源受限场景中的应用。面对这一问题,近期研究试图将 BERT 压缩为小规模模型。然而,以往工作大多聚焦于单一压缩技术,很少关注不同方法的组合。当使用集成技术压缩 BERT 时,一个关键问题是如何设计整体压缩框架以获得最优性能。针对该问题,我们集成了三类压缩方法(权重剪枝、低秩分解和知识蒸馏(KD)),并探索了关于模型架构、KD 策略、剪枝频率和学习率调度的多种设计。我们发现,精心设计这些方案对压缩模型的性能至关重要。基于实证发现,我们最佳的压缩模型被称为 Refined BERT cOmpreSsion with InTegrAted techniques (ROSITA),其参数量比 BERT 小 ,同时在 GLUE 基准的五个任务上保持 的性能,优于参数预算相近的以往 BERT 压缩方法。代码已发布于 https://github.com/llyx97/Rosita。
引用
@article{arxiv.2103.11367,
title = {ROSITA: Refined BERT cOmpreSsion with InTegrAted techniques},
author = {Yuanxin Liu and Zheng Lin and Fengcheng Yuan},
journal= {arXiv preprint arXiv:2103.11367},
year = {2021}
}
备注
Published as a conference paper at AAAI 2021