AutoDistill:一种探索并蒸馏硬件高效语言模型的端到端框架
机器学习
2022-01-24 v1
摘要
近年来,大型预训练模型显著提升了各类自然语言处理(NLP)任务的性能,但由于较长的服务延迟和较大的内存占用,其部署成本高昂。为压缩这些模型,知识蒸馏作为最有效的模型压缩方法之一受到了越来越多的关注。然而,现有的蒸馏方法尚未解决数据中心模型服务所特有的挑战,例如处理快速演进的模型、考虑服务性能以及优化多目标。为解决这些问题,我们提出了 AutoDistill,一个端到端的模型蒸馏框架,集成了模型架构探索与多目标优化,用于构建硬件高效的 NLP 预训练模型。我们使用贝叶斯优化进行多目标神经架构搜索以选择学生模型架构。所提出的搜索综合考虑了预测精度和目标硬件上的服务延迟。在 TPUv4i 上的实验发现了七种模型架构,其预训练精度(最高高 3.2%)优于 MobileBERT 且推理延迟更低(最高快 1.44 倍)。通过在 GLUE 基准上运行下游 NLP 任务,AutoDistill 预训练蒸馏出的含 28.5M 参数的模型取得了 81.69 的平均分数,高于 BERT_BASE、DistillBERT、TinyBERT、NAS-BERT 和 MobileBERT。AutoDistill 发现的最紧凑模型仅含 20.6M 参数,但在 GLUE 平均分数上仍优于 BERT_BASE(109M)、DistillBERT(67M)、TinyBERT(67M)和 MobileBERT(25.3M)。通过在 SQuAD 上评估,AutoDistill 发现的模型以 22.8M 参数取得了 88.4% 的 F1 分数,参数减少超过 62%,同时精度高于 DistillBERT、TinyBERT 和 NAS-BERT。
引用
@article{arxiv.2201.08539,
title = {AutoDistill: an End-to-End Framework to Explore and Distill Hardware-Efficient Language Models},
author = {Xiaofan Zhang and Zongwei Zhou and Deming Chen and Yu Emma Wang},
journal= {arXiv preprint arXiv:2201.08539},
year = {2022}
}