SCALAR:基准测试 SAE 交互稀疏性
机器学习
2025-11-12 v1
摘要
机械可解释性旨在将神经网络分解为可解释特征并映射其连接电路。标准方法是在每个层的激活值上训练稀疏自编码器 (SAE)。然而,孤立训练的 SAE 不鼓励稀疏的跨层连接,导致提取的电路中上游特征不必要地影响多个下游特征。当前的评估关注单个 SAE 的性能,留下了交互稀疏性的检验。我们引入 SCALAR(稀疏连接评估潜在激活关系),用于衡量 SAE 特征之间的交互稀疏性。我们还提出了“阶梯式 SAE”,通过权重共享限制上游特征在下游特征中的复制。使用 SCALAR,我们比较了 TopK SAE、Jacobian SAE (JSAE) 和阶梯式 SAE。阶梯式 SAE 在(前馈)和(transformer 块)方面分别比 TopK SAE 提升了 和 的相对稀疏性。JSAE 在前馈层比 TopK 提升了 ,但无法在 transformer 块上有效训练,不同于阶梯式 SAE 和 TopK SAE 在残差流中可工作。我们在 216K 参数的玩具模型和 GPT- Small (M) 上进行验证,其中阶梯式 SAE 在保持特征可解释性的同时维持了交互稀疏性改进。我们的工作通过基准测试和比较有前景的架构突显了 SAE 中交互稀疏性的重要性。
引用
@article{arxiv.2511.07572,
title = {SCALAR: Benchmarking SAE Interaction Sparsity in Toy LLMs},
author = {Sean P. Fillingham and Andrew Gordon and Peter Lai and Xavier Poncini and David Quarel and Stefan Heimersheim},
journal= {arXiv preprint arXiv:2511.07572},
year = {2025}
}