中文

自动可解释性指标无法区分训练型与随机变换器

机器学习 2026-01-28 v2

摘要

稀疏自编码器(SAE)广泛用于从变换器激活中提取稀疏、可解释的潜在特征。我们测试了一些常用的 SAE 质量指标和自动解释管道是否能够区分训练后的变换器与随机初始化的变换器(例如参数从高斯分布中独立抽样)。在多种 Pythia 模型规模和多种随机化方案下,我们发现,在许多情况下,对随机初始化的变换器训练的 SAE 产生的自动可解释性得分和重建指标与训练模型的结果相似。这表明,高的整体自动可解释性得分本身并不保证已恢复了学习到的、计算相关的特征。因此,我们建议将常见的 SAE 指标视为有用但不足以作为机制可解释性的代理指标,并主张在常规基准测试中包含随机基准以及针对特征“抽象性”的针对性措施。

关键词

引用

@article{arxiv.2501.17727,
  title  = {Automated Interpretability Metrics Do Not Distinguish Trained and Random Transformers},
  author = {Thomas Heap and Tim Lawson and Lucy Farnik and Laurence Aitchison},
  journal= {arXiv preprint arXiv:2501.17727},
  year   = {2026}
}