Gemma Scope:在Gemma 2上全面开放稀疏自编码器
机器学习
2024-08-20 v2 人工智能
计算与语言
摘要
稀疏自编码器(SAE)是一种无监督方法,用于将神经网络的潜在表示学习分解为看似可解释的特征。尽管近期对其潜力令人振奋,但研究应用在工业界之外受到训练全面SAE套件的高成本限制。在本工作中,我们引入了Gemma Scope,一个开放套件,包含在Gemma 2 2B和9B所有层与子层以及Gemma 2 27B选定层上训练的JumpReLU SAE。我们主要在Gemma 2预训练模型上训练SAE,但额外发布在指令微调的Gemma 2 9B上训练的SAE以供对比。我们在标准指标上评估每个SAE的质量并发布结果。我们希望通过发布这些SAE权重,帮助社区更轻松地进行更大胆的安全性与可解释性研究。权重和教程可在https://huggingface.co/google/gemma-scope获取,交互式演示可在https://www.neuronpedia.org/gemma-scope获取。
引用
@article{arxiv.2408.05147,
title = {Gemma Scope: Open Sparse Autoencoders Everywhere All At Once on Gemma 2},
author = {Tom Lieberum and Senthooran Rajamanoharan and Arthur Conmy and Lewis Smith and Nicolas Sonnerat and Vikrant Varma and János Kramár and Anca Dragan and Rohin Shah and Neel Nanda},
journal= {arXiv preprint arXiv:2408.05147},
year = {2024}
}
备注
12 main text pages, and 14 pages of acknowledgements, references and appendices