NAS-BERT:基于神经架构搜索的任务无关自适应尺寸BERT压缩
计算与语言
2021-06-01 v1 人工智能
机器学习
摘要
尽管预训练语言模型(如BERT)在不同自然语言处理任务上取得了令人印象深刻的成果,但它们参数量巨大,且面临高昂的计算与内存开销,难以在实际场景中部署。因此,模型压缩对于降低预训练模型的计算与内存成本十分必要。本工作中,我们旨在压缩BERT并解决以下两个具有挑战性的实际问题:(1)压缩算法应能够输出多个不同尺寸与延迟的压缩模型,以支持具有不同内存和延迟限制的设备;(2)算法应与下游任务无关,使压缩后的模型可普遍适用于不同下游任务。我们利用神经架构搜索(NAS)技术并提出NAS-BERT,一种高效的BERT压缩方法。NAS-BERT在一个包含多种架构的搜索空间上训练一个大型超网,并输出多个具有自适应尺寸和延迟的压缩模型。此外,NAS-BERT的训练在标准自监督预训练任务(如掩码语言模型)上进行,不依赖于特定下游任务。因此,压缩后的模型可跨多种下游任务使用。NAS-BERT的技术难点在于在预训练任务上训练大型超网成本极高。我们采用了包括分块搜索、搜索空间剪枝和性能近似在内的多种技术来提升搜索效率与精度。在GLUE和SQuAD基准数据集上的大量实验表明,NAS-BERT能找到比以往方法精度更高且更轻量的模型,并可直接应用于不同下游任务,针对内存或延迟的不同需求提供自适应模型尺寸。
引用
@article{arxiv.2105.14444,
title = {NAS-BERT: Task-Agnostic and Adaptive-Size BERT Compression with Neural Architecture Search},
author = {Jin Xu and Xu Tan and Renqian Luo and Kaitao Song and Jian Li and Tao Qin and Tie-Yan Liu},
journal= {arXiv preprint arXiv:2105.14444},
year = {2021}
}
备注
Accepted by KDD 2021