迈向 BERT 的结构化动态稀疏预训练
计算与语言
2021-08-16 v1 机器学习
摘要
确定用于大型语言模型计算高效无监督训练的算法是一个重要且活跃的研究领域。在这项工作中,我们开发并研究了一种直接、动态的始终稀疏的 BERT 语言建模任务预训练方法,该方法利用基于幅度剪枝随后进行随机参数重分配的周期性压缩步骤。该方法使我们能够在广泛的网络规模范围内,相对于静态稀疏和稠密模型,在浮点运算次数(FLOPs)方面实现帕累托改进。此外,我们证明了当使用粗粒度块稀疏时训练仍保持 FLOP 高效,这使其在现代硬件加速器上的高效执行尤为可期。
引用
@article{arxiv.2108.06277,
title = {Towards Structured Dynamic Sparse Pre-Training of BERT},
author = {Anastasia Dietrich and Frithjof Gressmann and Douglas Orr and Ivan Chelombiev and Daniel Justus and Carlo Luschi},
journal= {arXiv preprint arXiv:2108.06277},
year = {2021}
}