稠密 SAE 潜在变量是特征,而非缺陷
高能物理 - 理论
2025-06-19 v1
摘要
稀疏自编码器(SAE)旨在通过强制稀疏约束从语言模型中提取可解释特征。理想情况下,训练 SAE 可得到稀疏且语义明确的潜在变量。然而,许多 SAE 潜在变量激活频繁(即为 \emph{dense}),引发担忧其为训练程序的不可取产物。本文系统性地探讨稠密潜在变量的几何结构、功能及来源,表明它们不仅持久且常反映有意义的模型表示。首先,我们证明稠密潜在变量倾向于形成两极配对,用于重构残差流中的特定方向,剔除其子空间可抑制重新训练 SAE 中新稠密特征的出现——表明稠密特征是残差空间的内在属性。随后,我们提出稠密潜在变量的分类体系,识别与位置跟踪、语境绑定、熵调节、字母特定输出信号、词性及主成分重构相关的类别。最后,我们分析这些特征在各层中的演化,揭示从早期层的结构特征转向中期层的语义特征,再到后期层的输出导向信号。我们的发现表明,稠密潜在变量在语言模型计算中发挥着功能性作用,不应被视为训练噪声。
引用
@article{arxiv.2506.15678,
title = {A universal W-algebra for N=4 super Yang-Mills},
author = {Federico Bonetti and Carlo Meneghelli},
journal= {arXiv preprint arXiv:2506.15678},
year = {2025}
}