使用IHT学习稀疏神经网络
机器学习
2024-07-18 v2
摘要
优良模型的核心在于其仅聚焦于能反映基本模式与一致性的重要信息,从而从数据集中抽取出清晰且无噪声的信号,这就需要由更少参数构成的简化模型。由于计算训练力量的提升导致模型参数数量的增加,实际情境中常将大型模型简化为参数更少的可管理版本。理解为何参数更少的简化模型仍保持有效性,是一个关键问题。这引出更广泛的问题:是否存在理论框架能清晰解释这些经验观察。近期进展在于确立迭代硬阈值(IHT)收敛至稀疏局部最小值的必要条件——一种类似梯度下降的稀疏方法——这一令人振奋的发现。IHT算法准确识别并学习非零参数位置的卓越能力,凸显了其实际有效性与实用性。本文旨在探讨IHT算法在神经网络(NN)训练中是否适用,通过为收敛提供所有必要条件的论证,进而通过在单层NN上使用IRIS数据集进行实验验证这些条件。
引用
@article{arxiv.2404.18414,
title = {Learning a Sparse Neural Network using IHT},
author = {Saeed Damadi and Soroush Zolfaghari and Mahdi Rezaie and Jinglai Shen},
journal= {arXiv preprint arXiv:2404.18414},
year = {2024}
}