评估由GPT-2中的SAE潜变量组成的合成激活
机器学习
2024-11-19 v2
摘要
稀疏自编码器(SAEs)在机制可解释性中常被用来将残差流分解为单语义的SAE潜变量。最近的研究表明,在早期层扰动模型的激活会导致模型最终层激活产生类似阶跃函数的变化。此外,模型对此扰动的敏感性在模型生成的(真实)激活和随机激活之间有所不同。在我们的研究中,我们评估模型敏感性,以比较真实激活与由SAE潜变量组成的合成激活。我们的研究结果表明,当我们控制组成SAE潜变量的稀疏性和余弦相似度时,合成激活与真实激活非常相似。这表明真实激活不能用一个缺乏内部结构的简单“SAE潜变量包”来解释,反而表明SAE潜变量具有显著的几何和统计特性。值得注意的是,我们观察到我们的合成激活表现出不太明显的激活平台,而真实激活周围通常存在这些平台。
引用
@article{arxiv.2409.15019,
title = {Evaluating Synthetic Activations composed of SAE Latents in GPT-2},
author = {Giorgi Giglemiani and Nora Petrova and Chatrik Singh Mangat and Jett Janiak and Stefan Heimersheim},
journal= {arXiv preprint arXiv:2409.15019},
year = {2024}
}
备注
Presented at the Attributing Model Behavior at Scale (ATTRIB) workshop at NeurIPS 2024