在词汇空间中解耦多层感知机神经元权重
计算与语言
2026-04-08 v1
摘要
解读模型权重中编码的信息仍是机制可解释性的基本挑战。本文提出 ROTATE(Rotation-Optimized Token Alignment in weighT spacE),一种无需前向传播的数据无关方法,直接在权重空间中解耦多层感知机神经元。我们的方法依赖于一个关键统计观察:在词汇空间中投影时,编码一致单义概念的神经元呈现高峰值。通过优化神经元权重的旋转以最大化其词汇空间峰度,我们恢复了稀疏、可解释的方向,将其命名为词汇通道。在 Llama-3.1-8B-Instruct 和 Gemma-2-2B-it 上的实验表明,ROTATE 一致地恢复了忠实于神经元行为的词汇通道。逐个消融词汇通道可选择性地禁用相应的输入激活或特定概念的激活。此外,聚合通道级描述可生成全面的神经元描述,在头对头比较中比优化的基于激活的基线方法性能高出 2-3 倍。通过提供神经元权重的数据无关分解,ROTATE 为解读语言模型提供了一个可扩展、细粒度的构建模块。
引用
@article{arxiv.2604.06005,
title = {Disentangling MLP Neuron Weights in Vocabulary Space},
author = {Asaf Avrahamy and Yoav Gur-Arieh and Mor Geva},
journal= {arXiv preprint arXiv:2604.06005},
year = {2026}
}