oBERTa:通过改进初始化、蒸馏与剪枝机制提升稀疏迁移学习
计算与语言
2023-06-07 v3 人工智能
机器学习
摘要
本文介绍了一系列 oBERTa 语言模型,这是一套易于使用的语言模型,使自然语言处理(NLP)从业者无需模型压缩专业知识即可获得快 3.8 至 24.3 倍的模型。具体而言,oBERTa 扩展了现有的剪枝、知识蒸馏与量化工作,并利用冻结嵌入改进蒸馏与模型初始化,从而在广泛的迁移任务上提供更高精度。在生成 oBERTa 时,我们探究了高度优化的 RoBERTa 与 BERT 在预训练与微调期间剪枝上的差异,发现其在微调时较不易压缩。我们在七个代表性 NLP 任务上探索 oBERTa 的使用,发现改进的压缩技术使剪枝后的 oBERTa 模型在 SQUAD V1.1 问答数据集上匹配 BERTbase 性能并超越 Prune OFA Large,尽管推理分别快 8 倍与 2 倍。我们发布代码、训练机制及相关模型以供广泛使用并促进使用与实验。
引用
@article{arxiv.2303.17612,
title = {oBERTa: Improving Sparse Transfer Learning via improved initialization, distillation, and pruning regimes},
author = {Daniel Campos and Alexandre Marques and Mark Kurtz and ChengXiang Zhai},
journal= {arXiv preprint arXiv:2303.17612},
year = {2023}
}
备注
SustaiNLP2023 @ ACL 2023,9 pages, 2 figures, 45 tables