Sparse-IFT:用于最大化训练效率的稀疏等FLOP变换
机器学习
2024-07-19 v4 计算与语言
计算机视觉与模式识别
摘要
近期研究聚焦于深度神经网络训练中的权重稀疏性以减少FLOPs,旨在提升效率(即相对于训练FLOPs的测试准确率)。然而,稀疏权重训练常会损害准确率,需要更长的训练 schedule 才能达到稠密模型的准确率。相比之下,我们的方法 Sparse-IFT(Sparse Iso-FLOP Transformations,稀疏等FLOP变换)利用稀疏性在保持稠密模型FLOPs的同时提升准确率。使用单一超参数(即稀疏水平),Sparse-IFT 高效替换稠密层,扩展了最优稀疏掩码的搜索空间。此外,采用 Sparse-IFT 模型的动态稀疏训练(DST)能有效探索这一更大的稀疏掩码-权重空间,利用 Ramanujan 图性质进行的谱分析证实了这一点。我们的研究揭示了掩码拓扑、权重与最终性能之间的稳健关联。值得注意的是,在不调整任何训练超参数的情况下,用 Sparse-IFT 替换稠密层带来了显著提升,例如 ResNet-18 在 ImageNet 上提升 +3.5%,GPT-3 Small 在 Open LLM leaderboard 上提升 +0.9%。据我们所知,这是首项通过一组易用的稀疏变换来利用稀疏性提升稠密模型准确率的工作。代码见:https://github.com/CerebrasResearch/Sparse-IFT。
引用
@article{arxiv.2303.11525,
title = {Sparse-IFT: Sparse Iso-FLOP Transformations for Maximizing Training Efficiency},
author = {Vithursan Thangarasa and Shreyas Saxena and Abhay Gupta and Sean Lie},
journal= {arXiv preprint arXiv:2303.11525},
year = {2024}
}
备注
14 pages, 5 figures, 6 Tables (Main Paper) + 8 pages (Supplementary Material). Published at ICML 2024