面向 BERT 的最优子架构提取
计算与语言
2020-11-10 v2 机器学习
摘要
我们借助神经架构搜索算法的最新突破,从 Devlin 等人(2018)提出的 BERT 架构中提取出一组最优的架构参数子集。这一最优子集被我们称为“Bort”,其规模明显更小:有效尺寸(即不计入嵌入层)为原始 BERT-large 架构的 ,净尺寸的 。Bort 还能够在 个 GPU 小时内完成预训练,这仅为性能最高的 BERT 参数架构变体 RoBERTa-large(Liu 等人,2019)预训练所需时间的 ,约为在相同硬件上训练 BERT-large 所需 GPU 小时世界纪录的 。它在 CPU 上也快 倍,并且性能优于该架构的其他压缩变体以及一些非压缩变体:在多个公开自然语言理解(NLU)基准上,相对于 BERT-large 取得了 至 (绝对)的性能提升。
引用
@article{arxiv.2010.10499,
title = {Optimal Subarchitecture Extraction For BERT},
author = {Adrian de Wynter and Daniel J. Perry},
journal= {arXiv preprint arXiv:2010.10499},
year = {2020}
}
备注
Preprint. Under review. Corrected typos on v2