中文

MetaSAEs:联合训练结合可分解性惩罚产生更原子的稀疏自编码器隐变量

机器学习 2026-04-07 v1 人工智能

摘要

稀疏自编码器(SAEs)越来越多地用于安全相关的应用,包括对齐检测和模型引导。这些用例要求 SAE 隐变量尽可能原子化。每个隐变量应代表从单一底层表示子空间中抽取的单一连贯概念。在实践中,SAE 隐变量会将表示子空间混合在一起。单个特征可能在语义上截然不同且无共同真实表示的语境中激活,使本已复杂的模型计算图景更加模糊。我们引入了一个联合训练目标,直接惩罚这种子空间混合。一个小的元 SAE 与主 SAE 一起训练,以稀疏地重建主 SAE 的解码器列;每当主 SAE 的解码器方向易于从元字典中重建时,主 SAE 就会受到惩罚。这种情况发生在隐变量方向位于由其他主方向张成的子空间中时。这会产生梯度压力,促使解码器方向更加相互独立,从而抵抗稀疏元压缩。在 GPT-2 large(第 20 层)上,与在相同数据上训练的相同独立 SAE 相比,所选配置将平均 φ|\varphi| 降低了 7.5%。自动可解释性(模糊测试)得分提高了 7.6%,为原子性增益提供了独立于训练和共现指标的外部验证。重建开销适中。在 Gemma 2 9B 上的结果是方向性的。在未完全收敛的 SAE 上,相同的参数化产生了最佳结果,Δ\DeltaFuzz 为 +8.6%+8.6\%。尽管是方向性的,但这是一个令人鼓舞的迹象,表明该方法可以迁移到更大的模型。定性分析证实,在多义性标记上激活的特征被分割成语义上不同的子特征,每个子特征专门针对一个不同的表示子空间。

关键词

引用

@article{arxiv.2604.03436,
  title  = {MetaSAEs: Joint Training with a Decomposability Penalty Produces More Atomic Sparse Autoencoder Latents},
  author = {Matthew Levinson},
  journal= {arXiv preprint arXiv:2604.03436},
  year   = {2026}
}