NarrowBERT:加速掩码语言模型预训练与推理
计算与语言
2023-06-07 v2 机器学习
摘要
大规模语言模型预训练是自然语言处理中一种非常成功的自监督学习形式,但随着模型与预训练语料库随时间不断增大,其计算开销日益昂贵。我们提出 NarrowBERT,一种改进的 transformer 编码器,可将掩码语言模型预训练的吞吐量提升超过 。NarrowBERT 对 transformer 模型进行稀疏化,使得自注意力查询与前馈层在预训练期间仅作用于每个句子的掩码词元,而非像通常的 transformer 编码器那样作用于所有词元。我们还表明,NarrowBERT 在推理时将吞吐量提升高达 ,且在 MNLI 等句子编码任务上性能下降极小(或无下降)。最后,我们考察了 NarrowBERT 在 IMDB 与 Amazon 评论分类以及 CoNLL NER 任务上的表现,并显示其与标准 BERT 性能相当。
引用
@article{arxiv.2301.04761,
title = {NarrowBERT: Accelerating Masked Language Model Pretraining and Inference},
author = {Haoxin Li and Phillip Keung and Daniel Cheng and Jungo Kasai and Noah A. Smith},
journal= {arXiv preprint arXiv:2301.04761},
year = {2023}
}
备注
To appear in ACL 2023 (main conference)