中文

PURE:通过识别相关电路将多义神经元转化为纯特征

计算机视觉与模式识别 2024-04-10 v1 人工智能 机器学习

摘要

机械可解释性领域旨在研究深度神经网络中单个神经元的作用。然而,单个神经元可能具有多义性,编码多个(不相关的)特征,这使得解释变得困难。我们提出了一种方法,通过将多义神经元分解为多个单义的“虚拟”神经元,来解开任何深度神经网络的多义性。这是通过识别每个“纯”特征的相关子图(“电路”)来实现的。我们展示了我们的方法如何找到并解开在ImageNet上训练的ResNet模型的各种多义单元。在使用CLIP评估特征可视化时,我们的方法有效地解开了表示,优于基于神经元激活的方法。代码可在https://github.com/maxdreyer/PURE获取。

关键词

引用

@article{arxiv.2404.06453,
  title  = {PURE: Turning Polysemantic Neurons Into Pure Features by Identifying Relevant Circuits},
  author = {Maximilian Dreyer and Erblina Purelku and Johanna Vielhaben and Wojciech Samek and Sebastian Lapuschkin},
  journal= {arXiv preprint arXiv:2404.06453},
  year   = {2024}
}

备注

14 pages (4 pages manuscript, 2 pages references, 8 pages appendix)