SPION:基于卷积泛洪填充的 Transformer 逐层稀疏训练
机器学习
2023-09-25 v1 分布式、并行与集群计算
摘要
对 Transformer 进行稀疏化引起了相当大的兴趣,因为 Transformer 的训练计算需求极高。先前稀疏化 Transformer 的努力要么使用固定模式,要么使用数据驱动的方法来减少涉及多头注意力计算的操作数量,而多头注意力是 Transformer 的主要瓶颈。然而,现有方法存在不可避免的问题,例如由于跨所有层应用的均匀固定模式导致序列关键特征的潜在丢失,以及由于使用额外参数学习注意力操作中的稀疏模式而导致模型尺寸增大。本文提出了一种新颖的 Transformer 稀疏化方案,该方案集成卷积滤波器和泛洪填充(flood filling)方法,以有效捕获注意力操作中的逐层稀疏模式。我们的稀疏化方法降低了 Transformer 在训练期间的计算复杂度和内存占用。在 GPU 上开发了逐层稀疏化注意力算法的高效实现,展示了一种新的 SPION,其相比现有最先进的稀疏 Transformer 模型实现了高达 3.08 倍的加速,且具有更好的评估质量。
引用
@article{arxiv.2309.12578,
title = {SPION: Layer-Wise Sparse Training of Transformer via Convolutional Flood Filling},
author = {Bokyeong Yoon and Yoonsang Han and Gordon Euhyun Moon},
journal= {arXiv preprint arXiv:2309.12578},
year = {2023}
}