中文

BatchTopK 稀疏自编码器

机器学习 2024-12-10 v1 人工智能 机器学习

摘要

稀疏自编码器(SAE)已成为通过将语言模型激活分解为稀疏、可解释特征来解释语言模型激活的强大工具。TopK SAE 是一种流行方法,它使用每个样本中激活程度最高的固定数量的隐变量来重构模型激活。我们提出了 BatchTopK SAE,一种通过将 top-k 约束放松到批次级别来改进 TopK SAE 的训练方法,允许每个样本有可变数量的隐变量处于激活状态。因此,BatchTopK 根据样本自适应地分配更多或更少的隐变量,在不牺牲平均稀疏性的前提下改善重构。我们证明 BatchTopK SAE 在重构 GPT-2 Small 和 Gemma 2 2B 的激活方面始终优于 TopK SAE,并达到了与最先进的 JumpReLU SAE 相当的表现。然而,BatchTopK 的优势在于平均隐变量数量可以直接指定,而无需通过昂贵的超参数搜索进行近似调优。我们提供了在 https://github.com/bartbussmann/BatchTopK 训练和评估 BatchTopK SAE 的代码。

关键词

引用

@article{arxiv.2412.06410,
  title  = {BatchTopK Sparse Autoencoders},
  author = {Bart Bussmann and Patrick Leask and Neel Nanda},
  journal= {arXiv preprint arXiv:2412.06410},
  year   = {2024}
}