将多张票叠加为一张:稀疏神经网络训练的性能提升器
机器学习
2022-08-22 v3 人工智能
摘要
近期关于稀疏神经网络训练(稀疏训练)的工作表明,通过从头训练内在稀疏的神经网络,可以实现性能与效率之间引人注目的权衡。现有稀疏训练方法通常力求在一次单独运行中找到可能的最佳稀疏子网络,而不涉及任何昂贵的稠密或预训练步骤。例如,动态稀疏训练(DST)能够在训练过程中通过迭代演化稀疏拓扑结构,达到与稠密训练相竞争的性能。在本文中,我们认为更好地分配有限资源以创建多个低损失稀疏子网络并将它们叠加为一个更强的网络,而不是将所有资源完全用于寻找单个子网络。为此,需要满足两个要求:(1)在限于稠密训练所用标准训练时间的单一训练过程中高效产生许多低损失子网络,即所谓的廉价票;(2)将这些廉价票有效叠加为一个更强的子网络。为证实我们的猜想,我们提出了一种新颖的稀疏训练方法,称为 Sup-tickets,它能在单一的稀疏到稀疏训练过程中同时满足上述两个要求。在 CIFAR-10/100 和 ImageNet 上的各种现代架构中,我们表明 Sup-tickets 能与现有稀疏训练方法无缝集成并展示出一致的性能提升。
引用
@article{arxiv.2205.15322,
title = {Superposing Many Tickets into One: A Performance Booster for Sparse Neural Network Training},
author = {Lu Yin and Vlado Menkovski and Meng Fang and Tianjin Huang and Yulong Pei and Mykola Pechenizkiy and Decebal Constantin Mocanu and Shiwei Liu},
journal= {arXiv preprint arXiv:2205.15322},
year = {2022}
}
备注
17 pages, 5 figures, accepted by the 38th Conference on Uncertainty in Artificial Intelligence (UAI)