使用固定稀疏掩码训练神经网络
机器学习
2021-11-19 v1
摘要
在深度神经网络典型的基于梯度的训练过程中,模型的所有参数在每次迭代时都会更新。最近的工作表明,在训练期间仅更新模型参数的一小部分子集是可能的,这可以减轻存储和通信需求。在本文中,我们表明可以在模型参数上诱导一个固定稀疏掩码,以选择一个子集在多次迭代中进行更新。我们的方法利用具有最大Fisher信息的个参数构建掩码,作为对哪些参数对当前任务最重要的简单近似。在参数高效迁移学习和分布式训练的实验中,我们表明我们的方法在训练性能上匹配或超越了其他稀疏更新训练方法,同时在内存使用和通信成本方面更加高效。我们公开了我们的代码,以促进本方法的进一步应用。
引用
@article{arxiv.2111.09839,
title = {Training Neural Networks with Fixed Sparse Masks},
author = {Yi-Lin Sung and Varun Nair and Colin Raffel},
journal= {arXiv preprint arXiv:2111.09839},
year = {2021}
}