寻找快速Transformer:基于组件组合的一次性神经架构搜索
机器学习
2020-08-18 v1 机器学习
摘要
基于Transformer的模型在许多自然语言处理任务中取得了最先进的结果。然而,此类模型在推理时通常较慢,使得部署困难。在本文中,我们开发了一种高效算法以搜索快速模型同时保持模型质量。我们描述了一种将Transformer架构分解为更小组件的新方法,并提出一种基于采样的一次性架构搜索方法来寻找推理的最优模型。模型搜索过程比替代方案更高效,仅给训练时间增加少量开销。通过将我们的方法应用于BERT-base架构,我们在Cloud TPU-v2上实现了预训练BERT 10%到30%的加速,以及在先前最先进蒸馏BERT模型之上70%的加速,且性能下降通常可接受。
引用
@article{arxiv.2008.06808,
title = {Finding Fast Transformers: One-Shot Neural Architecture Search by Component Composition},
author = {Henry Tsai and Jayden Ooi and Chun-Sung Ferng and Hyung Won Chung and Jason Riesa},
journal= {arXiv preprint arXiv:2008.06808},
year = {2020}
}