中文

关于激活稀疏性与平坦最小值的联系

机器学习 2026-05-26 v1 人工智能

摘要

激活稀疏性在标准训练的 Transformer 的 MLP 模块中出现的观察提供了一个在不牺牲性能的情况下大幅度减少计算成本的机会。为了理论解释这一现象,现有工作表明激活稀疏性不源于数据属性或数据拟合,而是来自训练过程的隐式偏差。然而,这些联系是在强假设下的,这些假设不能应用于以大量步骤进行标准训练的深层模型。与这些工作不同,我们发现损失景观的平坦性也与 MLP 激活稀疏性密切相关,并且可作为标准深层网络中更弱且自然产生的假设。具体地,我们发现:1) MLP 激活稀疏性等于“增强平坦性”(加权平坦性度量之和)与输入范数和 MLP 激活梯度之积之间的比值。我们经验性地发现,这一比值在训练期间会减小,导致稀疏激活。2) 我们还提出了导数稀疏性的概念,该概念在 ReLU 情形下等价于激活稀疏性,但进一步允许在反向传播中进行修剪,并且比激活稀疏性更稳定。有了这些理论发现,我们可以通过三种方法来鼓励激活稀疏性,即减小分子并增大分母。这些即插即用的修改能够有效减少比值并产生更稀疏的激活。在 ImageNet-1K 和 C4 上实验表明,这些方法在推理稀疏性上至少提高了 36%,在训练稀疏性上至少提高了 50%,表明在推理和训练中都具有进一步的成本降低潜力。

关键词

引用

@article{arxiv.2605.25612,
  title  = {Towards the Connection between Activation Sparsity and Flat Minima},
  author = {Ze Peng and Jian Zhang and Lei Qi and Yang Gao and Yinghuan Shi},
  journal= {arXiv preprint arXiv:2605.25612},
  year   = {2026}
}