TrimBERT:为权衡而裁剪 BERT
计算与语言
2022-02-28 v1
摘要
基于 BERT 的模型在解决各类自然语言处理(NLP)任务上极为成功。遗憾的是,许多此类大模型在预训练与微调时需要大量计算资源和/或时间,限制了其更广泛的应用。尽管自注意力层已被充分研究,但文献中仍缺乏对其后中间层存在的充分依据。在本文中,我们表明减少 BERT-Base 中中间层的数量仅导致下游任务微调精度极小损失,同时显著减小模型规模与训练时间。我们进一步缓解两个关键瓶颈:将自注意力层中所有 softmax 操作替换为计算更简单的替代方案,并移除一半的 layernorm 操作。这进一步降低了训练时间,同时保持较高的微调精度。
引用
@article{arxiv.2202.12411,
title = {TrimBERT: Tailoring BERT for Trade-offs},
author = {Sharath Nittur Sridhar and Anthony Sarah and Sairam Sundaresan},
journal= {arXiv preprint arXiv:2202.12411},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:2012.11881