中文

更稀疏、更优、更深、更强:通过精确正交初始化改进稀疏训练

机器学习 2024-06-05 v1 人工智能

摘要

静态稀疏训练旨在从零开始训练稀疏模型,近年来取得了显著成果。一个关键的设计选择是稀疏初始化,它通过二值掩码确定可训练的子网络。现有方法主要基于预定义的稠密初始化来选择此类掩码。这种方法可能无法有效利用掩码对优化的潜在影响。受动力学等距性研究的启发,另一种方向是在稀疏子网络中引入正交性,这有助于稳定梯度信号。在这项工作中,我们提出了精确正交初始化(EOI),这是一种基于组合随机 Givens 旋转的新型稀疏正交初始化方案。与其他现有方法不同,我们的方法提供精确的(而非近似的)正交性,并允许创建具有任意密度的层。我们通过实验证明了 EOI 的卓越有效性和效率,始终优于常见的稀疏初始化技术。我们的方法能够在不使用残差连接或归一化技术的情况下,训练高度稀疏的 1000 层 MLP 和 CNN 网络,强调了权重初始化与稀疏掩码选择在静态稀疏训练中同等关键的作用。代码可在 https://github.com/woocash2/sparser-better-deeper-stronger 获取。

关键词

引用

@article{arxiv.2406.01755,
  title  = {Sparser, Better, Deeper, Stronger: Improving Sparse Training with Exact Orthogonal Initialization},
  author = {Aleksandra Irena Nowak and Łukasz Gniecki and Filip Szatkowski and Jacek Tabor},
  journal= {arXiv preprint arXiv:2406.01755},
  year   = {2024}
}

备注

ICML 2024