神经网络稀疏化的基本极限:来自不可解释崩溃的证据
机器学习
2026-04-10 v1
摘要
极端神经网络稀疏化(90%激活减少)为机理解释性提供了关键挑战:解释特征是否能在激进压缩后存活。本文探讨了在强大的容量约束下,特征在混合变分自编码器--稀疏自编码器 (VAE-SAE) 架构中的存活情况。我们引入一种自适应稀疏调度框架,逐步在50个训练周期内将活跃神经元从500减少到50,并提供关于稀疏化-解释性关系基本极限的实证证据。在两个基准数据集上进行测试——dSprites 和 Shapes3D,使用 Top-k 和 L1 稀疏化方法,我们的关键发现揭示了一种普遍的悖论:尽管全局表示质量(由互信息间隙衡量)保持稳定,但局部特征解释性系统性地崩溃。在 Top-k 稀疏化下,dSprites 上死神经元率达到 ,Shapes3D 上达到 (k=50)。L1 正则化——一种根本不同的“软约束”范式——产生相同或更差的崩溃:dSprites 上为 ,Shapes3D 上为 。额外训练100个周期无法恢复死神经元,崩溃模式对所有测试的阈值定义都稳健。关键的是,崩溃随数据集复杂度而比例增长:Shapes3D(RGB,6个因子)下的死神经元数比 dSprites(灰度,5个因子)高出 (Top-k)和 (L1)。这些发现确立了稀疏化下的解释性崩溃是压缩过程的内在属性,而非特定算法、训练时长或阈值选择的副作用。
引用
@article{arxiv.2603.18056,
title = {Fundamental Limits of Neural Network Sparsification: Evidence from Catastrophic Interpretability Collapse},
author = {Dip Roy and Rajiv Misra and Sanjay Kumar Singh},
journal= {arXiv preprint arXiv:2603.18056},
year = {2026}
}