自私稀疏 RNN 训练
机器学习
2021-06-16 v3 人工智能
摘要
稀疏神经网络已被广泛应用于降低过参数化深度神经网络的训练与部署的计算需求。对于推理加速,从预训练稠密网络中发现稀疏网络的方法(稠密到稀疏训练)行之有效。近来,动态稀疏训练(DST)被提出用于在无需预训练稠密模型的情况下训练稀疏神经网络(稀疏到稀疏训练),从而也可加速训练过程。然而,以往的稀疏到稀疏方法主要关注多层感知机网络(MLPs)与卷积神经网络(CNNs),在循环神经网络(RNNs)设定下未能匹配稠密到稀疏方法的性能。本文中,我们提出一种方法,在单次运行中以固定参数量训练本质稀疏的 RNNs,且不牺牲性能。训练期间,我们允许 RNN 层在单元门之间非均匀重分配以获得更好的正则化。进一步,我们提出 SNT-ASGD,一种平均随机梯度优化器的新型变体,其显著提升了所有 RNN 稀疏训练方法的性能。利用这些策略,我们在 Penn TreeBank 与 Wikitext-2 数据集上以各类 RNNs 取得了优于稠密到稀疏方法的 SOTA 稀疏训练结果。我们的代码见 https://github.com/Shiweiliuiiiiiii/Selfish-RNN。
引用
@article{arxiv.2101.09048,
title = {Selfish Sparse RNN Training},
author = {Shiwei Liu and Decebal Constantin Mocanu and Yulong Pei and Mykola Pechenizkiy},
journal= {arXiv preprint arXiv:2101.09048},
year = {2021}
}
备注
Published in Proceedings of the 38th International Conference on Machine Learning. Code can be found in https://github.com/Shiweiliuiiiiiii/Selfish-RNN