中文

ROSITA:基于集成技术的精炼 BERT 压缩方法

计算与语言 2021-03-23 v1

摘要

BERT 系列预训练语言模型在广泛的 NLP 任务中确立了最先进的性能。然而,基于 BERT 的模型的性能主要由海量参数驱动,这阻碍了它们在资源受限场景中的应用。面对这一问题,近期研究试图将 BERT 压缩为小规模模型。然而,以往工作大多聚焦于单一压缩技术,很少关注不同方法的组合。当使用集成技术压缩 BERT 时,一个关键问题是如何设计整体压缩框架以获得最优性能。针对该问题,我们集成了三类压缩方法(权重剪枝、低秩分解和知识蒸馏(KD)),并探索了关于模型架构、KD 策略、剪枝频率和学习率调度的多种设计。我们发现,精心设计这些方案对压缩模型的性能至关重要。基于实证发现,我们最佳的压缩模型被称为 Refined BERT cOmpreSsion with InTegrAted techniques (ROSITA),其参数量比 BERT 小 7.5×7.5 \times,同时在 GLUE 基准的五个任务上保持 98.5%98.5\% 的性能,优于参数预算相近的以往 BERT 压缩方法。代码已发布于 https://github.com/llyx97/Rosita。

关键词

引用

@article{arxiv.2103.11367,
  title  = {ROSITA: Refined BERT cOmpreSsion with InTegrAted techniques},
  author = {Yuanxin Liu and Zheng Lin and Fengcheng Yuan},
  journal= {arXiv preprint arXiv:2103.11367},
  year   = {2021}
}

备注

Published as a conference paper at AAAI 2021