中文

面向 BERT 的最优子架构提取

计算与语言 2020-11-10 v2 机器学习

摘要

我们借助神经架构搜索算法的最新突破,从 Devlin 等人(2018)提出的 BERT 架构中提取出一组最优的架构参数子集。这一最优子集被我们称为“Bort”,其规模明显更小:有效尺寸(即不计入嵌入层)为原始 BERT-large 架构的 5.5%5.5\%,净尺寸的 16%16\%。Bort 还能够在 288288 个 GPU 小时内完成预训练,这仅为性能最高的 BERT 参数架构变体 RoBERTa-large(Liu 等人,2019)预训练所需时间的 1.2%1.2\%,约为在相同硬件上训练 BERT-large 所需 GPU 小时世界纪录的 33%33\%。它在 CPU 上也快 7.97.9 倍,并且性能优于该架构的其他压缩变体以及一些非压缩变体:在多个公开自然语言理解(NLU)基准上,相对于 BERT-large 取得了 0.3%0.3\%31%31\%(绝对)的性能提升。

关键词

引用

@article{arxiv.2010.10499,
  title  = {Optimal Subarchitecture Extraction For BERT},
  author = {Adrian de Wynter and Daniel J. Perry},
  journal= {arXiv preprint arXiv:2010.10499},
  year   = {2020}
}

备注

Preprint. Under review. Corrected typos on v2