探索激活稀疏性在预训练中的优势
计算与语言
2024-10-07 v1 人工智能
摘要
预训练的 Transformer 本质上具有稀疏激活的特征,即每个 token 仅激活一小部分神经元。虽然稀疏激活通过后训练方法得到探索,但其在预训练中的潜力尚未被充分利用。在本工作中,我们首先研究激活属性在预训练期间的变化。我们的检查揭示,Transformer 在预训练过程的大部分时间段内表现出稀疏激活,但激活相关性随训练进度而演化。借助这一观察,我们提出 Switchable Sparse-Dense Learning(SSD)。SSD 在预训练过程中自适应地在基于 Mixtures-of-Experts(MoE)的稀疏训练和常规稠密训练之间切换,利用稀疏训练的效率并避免稀疏训练的静态激活相关性。相对于稠密训练,SSD 在相同模型规模下实现了相当的性能,并减少了预训练成本。此外,与 SSD 训练的模型可直接用作 MoE 模型进行稀疏推理,实现与稠密模型相同的性能,推理速度可提高最高达 。代码请参见 https://github.com/thunlp/moefication。
引用
@article{arxiv.2410.03440,
title = {Exploring the Benefit of Activation Sparsity in Pre-training},
author = {Zhengyan Zhang and Chaojun Xiao and Qiujieli Qin and Yankai Lin and Zhiyuan Zeng and Xu Han and Zhiyuan Liu and Ruobing Xie and Maosong Sun and Jie Zhou},
journal= {arXiv preprint arXiv:2410.03440},
year = {2024}
}
备注
ICML 2024