中文

从随机初始化进行稀疏训练:利用权重对称性对 lottery ticket 掩码进行对齐

机器学习 2025-08-18 v2

摘要

彩票票 hypothesis (LTH) 表明存在一种稀疏 LTH 掩码和权重,能够在使用显著更少参数的情况下实现与密集模型相同的泛化性能。然而,寻找 LTH 解决方案计算成本高昂,LTH 稀疏掩码对其他随机权重初始化不具可迁移性。最近的工作表明,神经网络从随机初始化训练后找到的解在置换意义上位于相同的损失域内,并提出了一种方法在同一损失域内对齐训练模型。我们假设掩码域的错位是 LTH 掩码无法迁移到新随机初始化的原因,并提出在进行稀疏训练时对 LTH 掩码进行置换,以对齐新的优化域。我们经验性地表明,使用置换后的 LTH 掩码进行随机初始化稀疏训练,其泛化性能显著高于使用未置换的 LTH 掩码,在多个数据集(CIFAR-10、CIFAR-100 和 ImageNet)和模型(VGG11、ResNet20 和 ResNet50)上进行了验证。

关键词

引用

@article{arxiv.2505.05143,
  title  = {Sparse Training from Random Initialization: Aligning Lottery Ticket Masks using Weight Symmetry},
  author = {Mohammed Adnan and Rohan Jain and Ekansh Sharma and Rahul G. Krishnan and Yani Ioannou},
  journal= {arXiv preprint arXiv:2505.05143},
  year   = {2025}
}

备注

Accepted at ICML 2025