弹性彩票假设
计算机视觉与模式识别
2021-10-29 v3 人工智能
机器学习
机器学习
摘要
彩票假设(LTH)引发了人们对识别稀疏可训练子网络(即中奖彩票)的强烈关注,这些子网络可独立训练,达到与完整模型相似甚至更好的性能。尽管已做出诸多努力,识别此类中奖彩票的最有效方法仍是迭代幅度剪枝(IMP),其计算代价高昂,且须针对每个不同网络完整运行。一个自然的问题是:我们能否将在一个网络中找到的中奖彩票“转换”到另一具有不同架构的网络,从而在初始阶段即得到后者的中奖彩票,而无需重新执行昂贵的 IMP?回答该问题不仅对于高效的“一次到位”中奖彩票寻找具有实际意义,也因揭示网络中固有的可扩展稀疏模式而具有理论吸引力。我们在 CIFAR-10 和 ImageNet 上进行了大量实验,并提出多种策略来调整从同一模型族(如 ResNets)不同网络中找到的中奖彩票。基于这些结果,我们阐明了弹性彩票假设(E-LTH):通过审慎地复制(或丢弃)并重新排序一个网络的层,其对应的中奖彩票可被拉伸(或压缩)为该族中另一个更深(或更浅)网络的子网络,其性能几乎与后者通过 IMP 直接找到的中奖彩票一样具有竞争力。我们还广泛地将 E-LTH 与初始化时剪枝和动态稀疏训练方法进行比较,并讨论了 E-LTH 对不同模型族、层类型及跨数据集的泛化能力。代码见 https://github.com/VITA-Group/ElasticLTH。
引用
@article{arxiv.2103.16547,
title = {The Elastic Lottery Ticket Hypothesis},
author = {Xiaohan Chen and Yu Cheng and Shuohang Wang and Zhe Gan and Jingjing Liu and Zhangyang Wang},
journal= {arXiv preprint arXiv:2103.16547},
year = {2021}
}
备注
Accepted at NeurIPS 2021