中文

论基于解扰的神经网络可解释性之局限

机器学习 2024-09-04 v3 数值分析 信号处理 数值分析

摘要

我们刻画了神经网络解扰(一种用于解释训练后神经网络(NN)全连接层的数学模型)的精确解。通过将问题重新表述为图匹配与复杂性理论中出现的 Brockett 函数的最小化,我们表明隐藏层预激活的主成分可被刻画为该层权重的最优解释器或解扰器,从而得到解扰后的权重矩阵。我们证明,在典型的深度学习情境中,这些解扰器呈现出多样且有趣的形式,包括:(1)对于各向同性隐藏数据,将最大主成分与傅里叶基的最低频模态相匹配;(2)针对信号恢复问题中的两层线性 NN,发现其语义发展过程;(3)通过最优置换神经元来解释 CNN。我们的数值实验表明,隐藏层数据的特征分解——现被理解为解扰器——也能揭示该层的底层变换。这些结果表明,SVD 与 NN 可解释性的关系比此前认为的更为直接,并为发现 NN 隐藏作用的可解释基序提供了一条有前景的途径,尤其是在算子学习或物理信息 NN 等输入/输出数据人类可读性有限的情境中。

关键词

引用

@article{arxiv.2301.07820,
  title  = {On the limits of neural network explainability via descrambling},
  author = {Shashank Sule and Richard G. Spencer and Wojciech Czaja},
  journal= {arXiv preprint arXiv:2301.07820},
  year   = {2024}
}