中文

通过激活光谱学理解分布式表征

机器学习 2025-01-28 v1 计算机视觉与模式识别

摘要

在神经网络可解释性研究中,越来越多的证据表明,相关特征以分布式方式编码在多个神经元中。没有对网络编码策略的了解的情况下,理解这些分布式表征是一个难以可计算的任务。本文探索了一种可行的路径,用于检测和追踪神经元在分布式表征中的联合影响。我们称该方法为激活光谱学(ActSpec),因为它分析定义于网络层激活模式上的伪布尔傅里叶光谱。给定层到输出逻辑 logits 之间的子网被视为一种特殊的伪布尔函数。通过该函数的傅里叶系数,可以量化每个神经元子集的贡献。我们提出了一种组合优化程序来搜索同时具有高值且非冗余的傅里叶系数。该程序可视为将额外问题特定约束纳入 Goldreich-Levin 算法中的扩展。 resulting 的系数指定一组子集,用于测试表征是否分布式的程度。我们在多个合成设置中验证了该方法,并与现有的可解释性基准进行了比较。我们以 MNIST 分类器和用于情感分析的 transformer 网络为例进行了实验评估。

关键词

引用

@article{arxiv.2501.15435,
  title  = {Making Sense Of Distributed Representations With Activation Spectroscopy},
  author = {Kyle Reing and Greg Ver Steeg and Aram Galstyan},
  journal= {arXiv preprint arXiv:2501.15435},
  year   = {2025}
}