Llama Scope:使用稀疏自编码器从 Llama-3.1-8B 中提取数百万特征
机器学习
2024-10-29 v1 计算与语言
摘要
稀疏自编码器(SAEs)已成为从语言模型中提取稀疏表示的强大无监督方法,但可扩展的训练仍然是一个重大挑战。我们引入了一套包含 256 个 SAEs 的模型套件,在 Llama-3.1-8B-Base 模型的每一层和子层上进行训练,具有 32K 和 128K 个特征。我们从多个维度评估了对最先进的 SAE 变体 Top-K SAEs 的修改。特别是,我们评估了在基础模型上训练的 SAEs 对更长上下文和微调模型的泛化能力。此外,我们分析了学习到的 SAE 潜变量的几何结构,证实了特征分裂(feature splitting)能够发现新特征。Llama Scope SAE 检查点可在 \url{https://huggingface.co/fnlp/Llama-Scope} 公开获取,同时我们的可扩展训练、解释和可视化工具可在 \url{https://github.com/OpenMOSS/Language-Model-SAEs} 获取。这些贡献旨在推进开源稀疏自编码器生态系统,并通过减少冗余 SAE 训练的需求来支持机制可解释性研究。
引用
@article{arxiv.2410.20526,
title = {Llama Scope: Extracting Millions of Features from Llama-3.1-8B with Sparse Autoencoders},
author = {Zhengfu He and Wentao Shu and Xuyang Ge and Lingjie Chen and Junxuan Wang and Yunhua Zhou and Frances Liu and Qipeng Guo and Xuanjing Huang and Zuxuan Wu and Yu-Gang Jiang and Xipeng Qiu},
journal= {arXiv preprint arXiv:2410.20526},
year = {2024}
}
备注
22pages, 12 figures