基于多层稀疃自编码器的残差流分析
机器学习
2025-02-25 v3 计算与语言
摘要
稀疃自编码器 (SAE) 是一种解释 transformer 语言模型内部表示的有前景方法。然而,SAE 通常分别训练在每个 transformer 层上,使其难以用于研究信息如何跨层流动。为解决此问题,我们引入了多层 SAE (MLSAE):一种训练在来自每个 transformer 层的残差流激活向量上的单一 SAE。鉴于残差流被认为在层之间保留信息,我们预期 MLSAE 潜在变量在某个 token 位置 '激活',并在后续层保持激活状态。有趣的是,我们发现单个潜在变量通常在给定 token 或提示的单个层上活跃,但单个潜在变量在不同 token 或提示下的活跃层可能不同。我们通过定义潜在激活分布的层分布并考虑其方差来量化这些现象。我们发现相对于单个 token,聚合 token 后的潜在激活分布方差大约高出两个数量级。对于更大的底层模型,潜在变量在多个层上活跃的程度增加,这与残差流激活向量在相邻层更接近的事实相一致。最后,我们放宽残差流基在每个层保持相同的假设,通过应用预训练的微调镜头变换,但我们的发现仍然呈现出类似的定性特征。我们的结果代表了理解表示如何通过 transformer 流动变化的新方法。我们发布了用于训练和分析 MLSAE 的代码:https://github.com/tim-lawson/mlsae
关键词
引用
@article{arxiv.2409.04185,
title = {Residual Stream Analysis with Multi-Layer SAEs},
author = {Tim Lawson and Lucy Farnik and Conor Houghton and Laurence Aitchison},
journal= {arXiv preprint arXiv:2409.04185},
year = {2025}
}
备注
ICLR 2025 Camera Ready. 45 pages, 41 figures