负预激活区分语法
机器学习
2026-03-03 v2
摘要
现代大型语言模型越来越多地使用光滑激活函数,如GELU或SiLU,允许负预激活携带信号和梯度。然而,许多神经元级可解释性分析历史上都关注较大的正激活,往往隐式地将负区域视为不够信息丰富,这是从ReLU时代继承的。我们挑战了这一假设,询问负预激活是否被模型所利用以及如何利用。我们通过研究 Wasserstein 神经元的稀疏亚群,其输出分布偏离高斯基准,并且在功能上区分相似输入。我们显示,这一负区域发挥积极作用,而不仅仅是梯度优化副作用。一种最小化、仅针对 Wasserstein 神经元的负预激活进行零化的特定干预,显著增加了困惑度,并在BLiMP和TSE上尖锐地降低语法性能,而对大量非Wasserstein神经元的随机或困惑度匹配消除,其负预激活几乎不影响语法性能。相反,在一套非语法基准测试中,困惑度匹配的对照消除比Wasserstein神经元消除更有破坏性,在语法与其他能力之间实现了双向解耦。词性分析将多余的惊讶局部化到语法支架标记,层级特定的干预显示,小的局部退化在深度上会累积,而训练动力学分析表明,相同的特定符号消除在Wasserstein神经元出现并稳定后变得更具破坏性。总之,这些结果确定了负预激活在稀疏亚群Wasserstein神经元中作为光滑激活语言模型语法的主动承担子strate。
引用
@article{arxiv.2509.24198,
title = {Negative Pre-activations Differentiate Syntax},
author = {Linghao Kong and Angelina Ning and Micah Adler and Nir Shavit},
journal= {arXiv preprint arXiv:2509.24198},
year = {2026}
}
备注
10 pages, 7 figures