稀疏但错误:不正确的 L0 导致稀疏自编码器中的错误特征
机器学习
2025-12-08 v3 人工智能
计算与语言
摘要
稀疏自编码器(SAE)从 LLM 内部激活中提取特征,旨在对应可解释的概念。SAE 训练的核心超参数之一是 L0:每个标记平均激活多少个 SAE 特征。现有工作通过稀疏-重构权衡图比较 SAE 算法,暗示 L0 是一个自由参数,除其对重构的影响外无其他单一正确值。本文研究了 L0 对 SAE 的影响,证明如果 L0 设置不正确,SAE 将无法分离 LLM 中的底层特征。如果 L0 过低,SAE 会混合相关特征以改善重构。如果 L0 过高,SAE 会找到退化解,同样混合特征。我们还提出了一种代理指标,可帮助指导在给定训练分布上寻找正确 L0 的搜索。我们表明该方法在玩具模型中找到正确的 L0,并在 LLM SAE 中与稀疏探针性能峰值相吻合。我们发现,大多数常用 SAE 的 L0 设置得太低。我们的工作表明,必须正确设置 L0 才能训练出具有正确特征的 SAE。
引用
@article{arxiv.2508.16560,
title = {Sparse but Wrong: Incorrect L0 Leads to Incorrect Features in Sparse Autoencoders},
author = {David Chanin and Adrià Garriga-Alonso},
journal= {arXiv preprint arXiv:2508.16560},
year = {2025}
}