中文

基于平坦极小与对抗鲁棒性的激活稀疏性理论解释

机器学习 2023-10-27 v4

摘要

近期关于 MLP 块中激活稀疏性的经验观测(Li et al., 2022b)为免费大幅降低计算成本提供了契机。尽管已有研究将其归因于训练动态,现有对激活稀疏性的理论解释局限于浅层网络、少量训练步与特殊训练,而该现象实则在标准训练大量步数的深层模型中自然涌现。为弥补这些缺口,我们提出梯度稀疏性作为激活稀疏性的一个来源,并基于它给出一种理论解释,将稀疏性视为针对隐藏特征与参数的对抗鲁棒性(约等于良训练模型极小值的平坦度)的必经步骤。该理论适用于标准训练的带 LayerNorm 的 MLP,并进一步适用于以权噪声训练的 Transformer 或其他架构。在排除除稀疏性外的其他平坦度来源后,我们发现权重矩阵最大与最小非零奇异值之比很小的现象。在讨论此种谱集中的涌现时,我们使用随机矩阵理论(RMT)作为分析随机梯度噪声的有力工具。我们开展了验证实验以证实基于梯度稀疏性的解释。我们提出两个即插即用模块,分别用于训练与微调以实现稀疏性。在 ImageNet-1k 与 C4 上的实验显示其稀疏性提升 50%,表明在训练与推理中进一步降低成本的潜力。

关键词

引用

@article{arxiv.2309.03004,
  title  = {A Theoretical Explanation of Activation Sparsity through Flat Minima and Adversarial Robustness},
  author = {Ze Peng and Lei Qi and Yinghuan Shi and Yang Gao},
  journal= {arXiv preprint arXiv:2309.03004},
  year   = {2023}
}