中文

CE-Bench:稀疏自编码器可解释性对比评估基准

计算与语言 2025-09-30 v2

摘要

稀疏自编码器(SAEs)是一种探索大型语言模型(LLMs)中可解释特征的有前景方法。虽然已存在几种用于 SAEs 的自动评估方法,但大多数依赖外部 LLM。本工作引入 CE-Bench,一个基于对比故事对构建的轻量级对比评估基准,用于稀疏自编码器。我们进行全面评估研究以验证方法的有效性。我们的结果表明,CE-Bench 可靠地测量稀疏自编码器的可解释性,并与现有基准良好一致,无需外部 LLM 评判,实现超过 70% 的 Spearman 相关性。官方实现和评估数据集已开源公开。

关键词

引用

@article{arxiv.2509.00691,
  title  = {CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders},
  author = {Alex Gulko and Yusen Peng and Sachin Kumar},
  journal= {arXiv preprint arXiv:2509.00691},
  year   = {2025}
}