中文

Exemplar Partitioning:用于机制解释的示例分区

机器学习 2026-05-19 v2

摘要

我们提出 Exemplar Partitioning(EP),一种从大语言模型激活构建可解释特征字典的无监督方法,其标记数比可比稀疏自编码器(SAE)少约 10310^3 倍。EP 字典是激活空间的 Voronoi 分区,通过在距离阈值内对流式激活进行领袖聚类构建。每个区域都由观察到的示例锚定,既作为其成员资格标准,也作为干预方向;字典大小无需预设,而是由该阈值下的激活几何决定。由于示例是观察得到的而非学习得到的,因此来自相同数据流构建的字典在不同层、不同模型及不同训练检查点之间直接可比较。我们通过针对该构造新获得的属性进行有针对性的演示,以及一项头盼基准,来表征 EP 作为一种解释性对象。Gemma-2-2B 中,EP 字典区域具有可解释性并支持因果干预:在指令调优 Gemma 中,拒绝行为集中于一个区域,其示例删减可导致拒绝行为的崩溃。跨检查点匹配将基座模型与指令调优模型的字典区分开来,从而分离出通过微调保留的方向与由此引入的方向。EP 区域与 Gemma Scope SAE 特征在分解激活空间方面不同,但在共享核心方面达成一致:约 20%20\% 的 EP 区域在 F1>0.5F_1 > 0.5 时匹配某个 SAE 特征,EP 单热门户保留约 97%97\% 的原始激活探测准确度,仅需 0=1\ell_0 = 1。最近示例距离为推理时的免费离群信号。AxBench 在 Gemma-2-2B-it L20 上进行的潜在概念检测显示,EP 在 p1p_1 处达到平均 AUROC 0.881,较规范 GemmaScope SAE 排行榜条目高出 0.126,仅略低于 SAE-A 的 0.911,同时构建计算成本约为其 10310^3 倍。

关键词

引用

@article{arxiv.2605.14347,
  title  = {Exemplar Partitioning for Mechanistic Interpretability},
  author = {Jessica Rumbelow},
  journal= {arXiv preprint arXiv:2605.14347},
  year   = {2026}
}

备注

Code: https://github.com/jessicarumbelow/exemplar-partitioning. Pretrained dictionaries: https://huggingface.co/datasets/J-RUM/exemplar-partitioning