中文

AutoTinyBERT:面向高效预训练语言模型的自动超参数优化

计算与语言 2021-07-30 v1 机器学习

摘要

预训练语言模型(PLMs)在自然语言处理中取得了巨大成功。大多数 PLM 沿用了 BERT(Devlin et al., 2019)中架构超参数的默认设置(例如,前馈子网络中隐藏维度为中间维度的四分之一)。极少有研究探索 BERT 中架构超参数的设计,尤其是对于尺寸极小的更高效的 PLM,而这在实际部署于资源受限设备时至关重要。本文采用一次性神经架构搜索(NAS)来自动搜索架构超参数。具体而言,我们精心设计一次性学习技术与搜索空间,为各种延迟约束下的微小 PLM 提供自适应且高效的开发方式。我们将该方法命名为 AutoTinyBERT,并在 GLUE 与 SQuAD 基准上评估其有效性。大量实验表明,我们的方法优于 SOTA 基于搜索的基线(NAS-BERT)与 SOTA 基于蒸馏的方法(如 DistilBERT、TinyBERT、MiniLM 和 MobileBERT)。此外,基于所获得的架构,我们提出了一种比单个 PLM 开发还要更快的高效开发方法。

关键词

引用

@article{arxiv.2107.13686,
  title  = {AutoTinyBERT: Automatic Hyper-parameter Optimization for Efficient Pre-trained Language Models},
  author = {Yichun Yin and Cheng Chen and Lifeng Shang and Xin Jiang and Xiao Chen and Qun Liu},
  journal= {arXiv preprint arXiv:2107.13686},
  year   = {2021}
}

备注

ACL 2021. The code and models are released at https://github.com/huawei-noah/Pretrained-Language-Model/tree/master/AutoTinyBERT