中文

SynthSAEBench:用于评估大规模真实合成数据上的稀疃自编码器

机器学习 2026-02-17 v1 人工智能

摘要

提高稀疃自编码器(SAE)的性能需要能够精确验证架构创新的基准。在 LLMs 上现有 SAE 基准往往噪声过大,难以区分架构改进;而现有合成数据实验规模较小且不够真实,难以提供有意义的比较。我们引入 SynthSAEBench,这是一个用于生成具有相关性、层次性和叠加性特征的大规模合成数据的工具包,以及标准化基准模型 SynthSAEBench-16k,使其能够直接比较 SAE 架构。我们的基准复现了若干先前观察到的 LLM SAE 现象,包括重构与潜在质量指标之间的脱节、SAE 检索结果的差差之下,以及由 L0 介导的精确-召回率权衡。我们进一步利用该基准识别了一种新的失效模式:匹配 pursuit SAE 利用叠加噪声以提高重构而不学习真实特征,表明更具表达力的编码器很容易过拟合。SynthSAEBench 通过提供真实特征和受控消融实验,补充了 LLM 基准,使研究者能够精确诊断 SAE 失效模式并在规模化到 LLMs 之前验证架构改进。

关键词

引用

@article{arxiv.2602.14687,
  title  = {SynthSAEBench: Evaluating Sparse Autoencoders on Scalable Realistic Synthetic Data},
  author = {David Chanin and Adrià Garriga-Alonso},
  journal= {arXiv preprint arXiv:2602.14687},
  year   = {2026}
}