中文

GLUScope:分析Transformer语言模型中GLU神经元的工具

计算与语言 2026-03-02 v1 机器学习

摘要

我们提出了GLUScope,这是一个用于分析Transformer-based语言模型中神经元的开源工具,旨在为可解释性研究人员提供支持。我们关注的模型比以前的工具更近些,具体而言是考虑门控激活函数,如SwiGLU。这引入了一个新的挑战:仅理解正激活是不够的。相反,神经元的门和in激活都可以是正的或负的,导致四种不同的符号组合,在某些情况下功能差异很大。因此,对于任意神经元,我们的工具显示每种符号组合的文本示例,并指示每种组合出现的频率。我们描述了一些示例,说明GLUScope如何导致新颖的见解。一个演示可在 https://sjgerstner.github.io/gluscope 上获得。

关键词

引用

@article{arxiv.2602.23826,
  title  = {GLUScope: A Tool for Analyzing GLU Neurons in Transformer Language Models},
  author = {Sebastian Gerstner and Hinrich Schütze},
  journal= {arXiv preprint arXiv:2602.23826},
  year   = {2026}
}

备注

6 pages for main body, 9 pages in total. 4 figures