中文

雅可比稀疏自编码器:稀疏化计算,而非仅稀疏化激活

机器学习 2025-06-09 v2 人工智能 计算与语言

摘要

稀疏自编码器(SAE)已成功用于发现大型语言模型(LLM)潜在激活的稀疏且可人工解释的表示。然而,我们最终希望理解的是 LLM 所执行的计算,而不仅仅是其表示。SAE 在多大程度上能帮助我们理解计算尚不明确,因为它们并非设计用于任何意义上的计算稀疏化,而仅对潜在激活进行稀疏化。为解决这一问题,我们提出了雅可比稀疏自编码器(JSAE),它不仅对给定模型组件的输入和输出激活产生稀疏性,还对连接它们的计算(形式上即雅可比矩阵)产生稀疏性。若采用朴素实现,LLM 中的雅可比矩阵由于其规模将在计算上不可处理。因此,一项关键的技术贡献在于找到了一种高效计算雅可比矩阵的方法。我们发现,JSAE 在保持下游 LLM 性能与传统 SAE 大致相当的条件下,提取了相对较高程度的计算稀疏性。我们还证明了雅可比矩阵是计算稀疏性的合理代理,因为将多层感知机(MLP)用 JSAE 基重写后近似是线性的。最后,我们证明了 JSAE 在预训练 LLM 上实现的计算稀疏性程度高于等价的随机化 LLM。这表明计算图的稀疏性似乎是 LLM 通过训练习得的性质,并暗示 JSAE 可能比标准 SAE 更适合理解经过训练的 transformer 计算。

关键词

引用

@article{arxiv.2502.18147,
  title  = {Jacobian Sparse Autoencoders: Sparsify Computations, Not Just Activations},
  author = {Lucy Farnik and Tim Lawson and Conor Houghton and Laurence Aitchison},
  journal= {arXiv preprint arXiv:2502.18147},
  year   = {2025}
}