CE-Bench:稀疏自编码器可解释性对比评估基准
计算与语言
2025-09-30 v2
摘要
稀疏自编码器(SAEs)是一种探索大型语言模型(LLMs)中可解释特征的有前景方法。虽然已存在几种用于 SAEs 的自动评估方法,但大多数依赖外部 LLM。本工作引入 CE-Bench,一个基于对比故事对构建的轻量级对比评估基准,用于稀疏自编码器。我们进行全面评估研究以验证方法的有效性。我们的结果表明,CE-Bench 可靠地测量稀疏自编码器的可解释性,并与现有基准良好一致,无需外部 LLM 评判,实现超过 70% 的 Spearman 相关性。官方实现和评估数据集已开源公开。
关键词
引用
@article{arxiv.2509.00691,
title = {CE-Bench: Towards a Reliable Contrastive Evaluation Benchmark of Interpretability of Sparse Autoencoders},
author = {Alex Gulko and Yusen Peng and Sachin Kumar},
journal= {arXiv preprint arXiv:2509.00691},
year = {2025}
}