双线性 MLP 启用基于权重的机制可解释性
机器学习
2025-06-26 v2 机器学习
摘要
深入神经网络中 MLP 如何进行计算的机制性理解仍然尚未充分。当前可解释性工作可以从隐藏激活中提取特征,但通常无法解释 MLP 权重如何构建特征。一个挑战是元素级非线性引入更高阶的相互作用,使得跟踪 MLP 层中的计算变得困难。本文分析双线性 MLP,这是一种在没有元素级非线性的情况下仍实现竞争性能的门控线性单元(GLU)。双线性 MLP 可以用第三阶张量完全表示,以线性操作为基础,允许对权重进行灵活的分析。通过对双线性 MLP 权重的谱分析进行特征分解,揭示了在玩具任务、图像分类和语言建模中均存在可解释的低秩结构。我们利用这种理解来制作对抗性样本,揭示过拟合现象,并直接从权重中识别小型语言模型电路。我们的结果表明,双线性层可作为当前激活函数的可解释替代品,且基于权重的可解释性对于理解深度学习模型是可行的。
引用
@article{arxiv.2410.08417,
title = {Bilinear MLPs enable weight-based mechanistic interpretability},
author = {Michael T. Pearce and Thomas Dooms and Alice Rigg and Jose M. Oramas and Lee Sharkey},
journal= {arXiv preprint arXiv:2410.08417},
year = {2025}
}
备注
Accepted to ICLR'25