中文

ReSAE: 用于多层Transformer干预的残差化稀疏自编码器

机器学习 2026-05-28 v1 人工智能

摘要

稀疏自编码器通常逐层训练,尽管Transformer残差流激活在深度上高度耦合。这给多层干预带来了实际问题:不同层的字典可能将容量用于表示相同的向前传递信息,同时替换多层可能产生单层行为无法预测的交互。我们引入了残差化稀疏自编码器(ReSAEs),它在选定层之间拟合一个仿射映射,并让后续层的SAE在未解释的残差上训练,而非在全激活上训练。重建结果通过拟合的仿射链映射回原始激活空间,因此ReSAEs可以采用与普通SAE相同的干预协议进行评估。在Pythia-1.4B和Gemma-2-9B上,残差化在大多数测试设置中降低了解码器冗余,并改进了稀疏探测和定向扰动。尽管重建的原始激活方差较少,但在多层替换下,ReSAEs恢复了更多的Transformer交叉熵。这种增益在教师强制和足够的在线稀疏性下最为明显,表明ReSAEs保留了与模型下游计算最相关的激活成分。这些结果表明,移除线性可预测的跨层结构是多层SAE干预的一个有用默认策略。

关键词

引用

@article{arxiv.2605.27819,
  title  = {ReSAE: Residualized Sparse Autoencoders for Multi-Layer Transformer Interventions},
  author = {Prathyush Poduval and Calvin Yeung and Neel Desai and Mohsen Imani},
  journal= {arXiv preprint arXiv:2605.27819},
  year   = {2026}
}