中文

利用恒等层学习稀疏神经网络

机器学习 2023-07-17 v1

摘要

深度神经网络的稀疏性已被充分研究,以尽可能最大化性能并缩减过参数化网络的规模。现有方法侧重于在训练过程中利用阈值和度量对参数进行剪枝。同时,不同层之间的特征相似性此前未被充分讨论,而本文可严格证明其与网络稀疏性高度相关。受过参数化模型中层间特征相似性的启发,我们探究了网络稀疏性与层间特征相似性之间的内在联系。具体而言,我们证明基于中心核对齐(CKA)降低层间特征相似性可利用信息瓶颈理论改善网络的稀疏性。应用该理论,我们提出了一种即插即用的基于 CKA 的稀疏正则化方法用于稀疏网络训练,称为 CKA-SR,其利用 CKA 降低层间特征相似性并增加网络稀疏性。换言之,我们的稀疏网络各层彼此相比趋向于具有自身的恒等性。在实验上,我们将提出的 CKA-SR 插入多种稀疏网络训练方法的训练过程中,发现 CKA-SR 持续提升了若干最先进(State-Of-The-Art)稀疏训练方法的性能,尤其在极高稀疏度下。代码包含在补充材料中。

关键词

引用

@article{arxiv.2307.07389,
  title  = {Learning Sparse Neural Networks with Identity Layers},
  author = {Mingjian Ni and Guangyao Chen and Xiawu Zheng and Peixi Peng and Li Yuan and Yonghong Tian},
  journal= {arXiv preprint arXiv:2307.07389},
  year   = {2023}
}