中文

神经网络稀疏化的基本极限:来自不可解释崩溃的证据

机器学习 2026-04-10 v1

摘要

极端神经网络稀疏化(90%激活减少)为机理解释性提供了关键挑战:解释特征是否能在激进压缩后存活。本文探讨了在强大的容量约束下,特征在混合变分自编码器--稀疏自编码器 (VAE-SAE) 架构中的存活情况。我们引入一种自适应稀疏调度框架,逐步在50个训练周期内将活跃神经元从500减少到50,并提供关于稀疏化-解释性关系基本极限的实证证据。在两个基准数据集上进行测试——dSprites 和 Shapes3D,使用 Top-k 和 L1 稀疏化方法,我们的关键发现揭示了一种普遍的悖论:尽管全局表示质量(由互信息间隙衡量)保持稳定,但局部特征解释性系统性地崩溃。在 Top-k 稀疏化下,dSprites 上死神经元率达到 34.4±0.9%34.4\pm0.9\%,Shapes3D 上达到 62.7±1.3%62.7\pm1.3\%(k=50)。L1 正则化——一种根本不同的“软约束”范式——产生相同或更差的崩溃:dSprites 上为 41.7±4.4%41.7\pm4.4\%,Shapes3D 上为 90.6±0.5%90.6\pm0.5\%。额外训练100个周期无法恢复死神经元,崩溃模式对所有测试的阈值定义都稳健。关键的是,崩溃随数据集复杂度而比例增长:Shapes3D(RGB,6个因子)下的死神经元数比 dSprites(灰度,5个因子)高出 1.8×1.8\times(Top-k)和 2.2×2.2\times(L1)。这些发现确立了稀疏化下的解释性崩溃是压缩过程的内在属性,而非特定算法、训练时长或阈值选择的副作用。

关键词

引用

@article{arxiv.2603.18056,
  title  = {Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse},
  author = {Dip Roy and Rajiv Misra and Sanjay Kumar Singh},
  journal= {arXiv preprint arXiv:2603.18056},
  year   = {2026}
}