中文

深度学习中谁做什么?神经单元功能的多维度游戏论归因

机器学习 2025-06-25 v1 人工智能

摘要

神经网络现在能够生成文本、图像和语音,参数量达数十亿,导致迫切需要了解每个神经单元对这些高维输出的贡献。现有的可解释AI方法(如SHAP)可对输入进行重要性归因,但无法量化神经单元在数千个输出像素、标记或logit上的贡献。本文通过多扰动Shapley值分析(MSA)填补了这一空白,这是一种基于游戏论的框架。通过系统性地对单位组合进行 lesioning,MSA产生Shapley模式,单元贡献图,其确切维度与模型输出维度相同。我们在不同规模上应用了MSA,从多层感知器到560亿参数的Mixtral-8x7B和生成对抗网络(GAN)。该方法展示了正则化如何将计算集中在少数枢纽中,揭示了LLM内部的语言特定专家,以及GAN中像素生成层级的倒置结构。这些结果共同展示了MSA作为一种强大的深度神经网络解释、编辑和压缩方法。

关键词

引用

@article{arxiv.2506.19732,
  title  = {Who Does What in Deep Learning? Multidimensional Game-Theoretic Attribution of Function of Neural Units},
  author = {Shrey Dixit and Kayson Fakhar and Fatemeh Hadaeghi and Patrick Mineault and Konrad P. Kording and Claus C. Hilgetag},
  journal= {arXiv preprint arXiv:2506.19732},
  year   = {2025}
}