如何在学术预算下训练 BERT
计算与语言
2021-09-10 v2 人工智能
机器学习
摘要
尽管类似 BERT 的大型语言模型在 NLP 中被普遍使用,但其预训练被视为只有少数资金充裕的工业实验室才能负担的奢侈行为。如何以更适度的预算训练此类模型?我们给出了一种使用单台低端深度学习服务器在 24 小时内预训练掩码语言模型的方案。我们证明,通过软件优化、设计选择与超参数调优的组合,有可能以原始预训练成本的一小部分生产出在 GLUE 任务上与 BERT-base 具有竞争力的模型。
引用
@article{arxiv.2104.07705,
title = {How to Train BERT with an Academic Budget},
author = {Peter Izsak and Moshe Berchansky and Omer Levy},
journal= {arXiv preprint arXiv:2104.07705},
year = {2021}
}