循环神经网络中的几何稀疏化
机器学习
2024-12-16 v2
摘要
改善运行大型神经模型计算成本的一种常用技术是稀疏化,即在训练期间修剪神经连接。稀疏模型能够保持 SOTA 模型的高准确率,同时以更精简模型的成本运行。然而,稀疏架构底层的结构目前知之甚少,并且在不同的训练模型和稀疏化方案之间不一致。在本文中,我们提出了一种称为模正则化的循环神经网络稀疏化新技术,并将其与幅度剪枝相结合。模正则化利用由循环结构诱导的动力系统,在 RNN 的隐藏状态中的神经元之间诱导出几何关系。通过使我们的正则化项显式地具有几何性质,据我们所知,我们首次提供了对神经网络所需稀疏架构的先验描述,以及对 RNN 几何的显式端到端学习。我们在多种条件下验证了方案的有效性,在导航、自然语言处理和加法 RNN 中进行了测试。导航是一项结构性几何任务,存在已知的模空间,我们表明只有当系数根据合适的模空间选择时,正则化才能在保持模型性能的同时达到 90% 的稀疏度。然而,自然语言处理和加法没有已知的执行计算的模空间。尽管如此,我们表明模正则化诱导出更稳定的循环神经网络,并在 90% 以上的稀疏度下实现了高保真模型。
引用
@article{arxiv.2406.06290,
title = {Geometric sparsification in recurrent neural networks},
author = {Wyatt Mackey and Ioannis Schizas and Jared Deighton and David L. Boothe, and Vasileios Maroulas},
journal= {arXiv preprint arXiv:2406.06290},
year = {2024}
}
备注
25 pages, 4 figures