LOFT:通过滤波器级训练寻找彩票票
机器学习
2022-10-31 v1 人工智能
信息论
math.IT
最优化与控制
摘要
近期关于彩票票假设(LTH)的研究表明,大型神经网络中存在“中奖票”。这些票代表完整模型的“稀疏”版本,可独立训练以达成相对于完整模型的可比精度。然而,寻找中奖票需要至少预训练(pretrain)大型模型若干个周期,这可能是一项繁重的任务,尤其当原始神经网络变得更大时。在本文中,我们探究如何高效识别此类中奖票的出现,并利用该观察设计高效的预训练算法。为表述清晰,我们聚焦于卷积神经网络(CNNs)。为识别良好滤波器,我们提出一种能很好表示模型收敛性的新颖滤波器距离度量。正如我们的理论所指,我们的滤波器分析与近期神经网络学习动力学的发现一致。受这些观察启发,我们提出“通过滤波器级训练的彩票票”算法,称为 \textsc{LoFT}。\textsc{LoFT} 是一种模型并行预训练算法,按滤波器划分卷积层以在分布式环境中独立训练它们,从而在预训练期间降低内存与通信成本。实验表明 \textsc{LoFT} 保留并找到良好的彩票票,同时 实现可观的计算与通信节省,并保持与其它预训练方法可比甚至更优的精度。
引用
@article{arxiv.2210.16169,
title = {LOFT: Finding Lottery Tickets through Filter-wise Training},
author = {Qihan Wang and Chen Dun and Fangshuo Liao and Chris Jermaine and Anastasios Kyrillidis},
journal= {arXiv preprint arXiv:2210.16169},
year = {2022}
}