数据节食下的彩票票:在稀疏可训练网络中寻找初始化
机器学习
2022-06-06 v1 人工智能
机器学习
摘要
关于迭代幅度剪枝(IMP;Frankle 等人 2020)的一个引人注目的观察是——在经过仅几百步的稠密训练后——该方法可以找到一种稀疏子网络,其可被训练至与稠密网络相同的精度。然而,在第 0 步(即随机初始化)时这一点并不成立。在本工作中,我们试图从数据分布与损失景观几何的视角,理解这一预训练早期阶段如何为 IMP 带来良好的初始化。我们通过实验观察到,在保持预训练迭代次数不变的情况下,仅在一小部分(随机选取的)数据上训练就足以获得同样良好的 IMP 初始化。我们还观察到,仅对“简单”训练数据进行预训练,与在全数据集或随机选取子集上训练相比,可减少寻找良好 IMP 初始化所需的步数。最后,我们识别出稠密网络损失景观中可预测 IMP 性能的新性质,特别表明稠密网络中更多样本呈线性模式连通与良好的 IMP 初始化密切相关。综上,这些结果对早期阶段训练在 IMP 中所起作用提供了新见解。
引用
@article{arxiv.2206.01278,
title = {Lottery Tickets on a Data Diet: Finding Initializations with Sparse Trainable Networks},
author = {Mansheej Paul and Brett W. Larsen and Surya Ganguli and Jonathan Frankle and Gintare Karolina Dziugaite},
journal= {arXiv preprint arXiv:2206.01278},
year = {2022}
}
备注
The first two authors contributed equally