用 PRISM 捕获多义性:一种多概念特征描述框架
机器学习
2025-11-13 v4 人工智能
计算与语言
摘要
自动可解释性研究旨在识别神经网络特征中编码的概念,以增强对模型行为的人类理解。在大型语言模型 (LLM) 用于自然语言处理 (NLP) 的上下文中,当前的自动神经元级特征描述方法面临两个关键挑战:局部性不足以及假设每个神经元仅编码单个概念 (单义性),尽管日益增加的证据表明存在多义性。这一假设限制了特征描述的表达力,并限制了其捕获模型内部所编码完整行为范围的能力。为此,我们引入 Polysemantic FeatuRe Identification and Scoring Method (PRISM),这是一个专为捕获 LLM 中特征的复杂性而设计的新型框架。不同于在许多自动可解释性方法中常见的为每个神经元分配单一描述的方法,PRISM 产生更细致的描述,既能考虑单义性也能考虑多义性。我们将 PRISM 应用于 LLM,并通过对现有方法进行大规模基准测试,表明我们的方法产生更准确、更忠实的特征描述,从而提升整体描述质量(通过描述得分)和捕获多义性情况下不同概念的能力(通过多义性得分)。
引用
@article{arxiv.2506.15538,
title = {Capturing Polysemanticity with PRISM: A Multi-Concept Feature Description Framework},
author = {Laura Kopf and Nils Feldhus and Kirill Bykov and Philine Lou Bommer and Anna Hedström and Marina M. -C. Höhne and Oliver Eberle},
journal= {arXiv preprint arXiv:2506.15538},
year = {2025}
}