利用损失景观中的退化性进行机理可解释性
机器学习
2024-05-21 v2
摘要
机理可解释性旨在通过研究神经网络的权重和激活来逆向工程其实现的算法。神经网络内部众多参数并未参与网络实现计算的这些退化参数可能遮蔽内部结构。奇异学习理论指出,神经网络参数化倾向于更具退化性,具有更高退化性的参数化更可能获得更好的泛化。我们识别了三种网络参数可退化的方式:层内激活之间的线性依赖;传递回层的梯度之间的线性依赖;受控函数在相同数据子集上的激活。我们还提出了模块化网络更可能具备退化性的启发式论证,并开发了一种基于该论证的用于识别网络中模块的度量方法。我们提出,如果能以一种对利用退化性进行 reparameterization 不变的表示方式来表示神经网络,则该表示很可能更具可解释性,我们的证据表明,这种表示很可能具有更稀疏的相互作用。我们引入了 Interaction Basis,这是一种可行的技术,用于从激活或雅可比矩阵的线性依赖性中获取抗退化性表示。
引用
@article{arxiv.2405.10927,
title = {Using Degeneracy in the Loss Landscape for Mechanistic Interpretability},
author = {Lucius Bushnaq and Jake Mendel and Stefan Heimersheim and Dan Braun and Nicholas Goldowsky-Dill and Kaarel Hänni and Cindy Wu and Marius Hobbhahn},
journal= {arXiv preprint arXiv:2405.10927},
year = {2024}
}