权重压缩:用于知识迁移与模型压缩的重参数化方法
机器学习
2021-08-31 v3 计算与语言
机器学习
摘要
在这项工作中,我们提出一种称为权重压缩(Weight Squeezing)的同步知识迁移与模型压缩新方法。该方法通过学习从教师模型权重到更小学生模型权重的映射,实现教师模型的知识迁移。我们将权重压缩应用于基于 BERT-Medium 模型的预训练文本分类模型,并在 GLUE 多任务基准上将其与其他多种知识迁移和模型压缩方法进行比较。我们观察到,我们的方法在取得更优结果的同时,训练学生模型的速度显著快于其他方法。我们还提出了一种称为门控权重压缩(Gated Weight Squeezing)的权重压缩变体,将 BERT-Medium 模型的微调与从 BERT-Base 权重学习映射相结合。我们表明,采用门控权重压缩进行微调优于单纯微调 BERT-Medium 模型以及其他同期 SoTA 方法,同时更易于实现。
引用
@article{arxiv.2010.06993,
title = {Weight Squeezing: Reparameterization for Knowledge Transfer and Model Compression},
author = {Artem Chumachenko and Daniil Gavrilov and Nikita Balagansky and Pavel Kalaidin},
journal= {arXiv preprint arXiv:2010.06993},
year = {2021}
}