学习稀疏激活的神经网络
机器学习
2024-06-27 v1 机器学习
摘要
许多成功的神经网络架构中包含的一个核心组件是包含非线性激活函数的两层全连接 MLP 块。一个被经验观察到的现象,包括在 Transformer 架构中,训练后,该 MLP 块隐藏层的激活在任何给定输入上都趋于极度稀疏。与传统稀疏形式不同,其中神经元/权重可以从网络中删除,这种动态激活稀疏形式似乎难以被利用以获得更高效的网络。我们受此启发,正式研究表现激活稀疏 MLP 层的 PAC 学习能力。我们 presenting 多种结果,表明此类函数会导致其非稀疏对应项在计算和统计上的可观优势。我们希望更好的理论理解能够引导实践中可利用激活稀疏的方法。
引用
@article{arxiv.2406.17989,
title = {Learning Neural Networks with Sparse Activations},
author = {Pranjal Awasthi and Nishanth Dikkala and Pritish Kamath and Raghu Meka},
journal= {arXiv preprint arXiv:2406.17989},
year = {2024}
}
备注
Proceedings of the 37th Conference on Learning Theory (COLT 2024), 20 pages