Exemplar Partitioning:用于机制解释的示例分区
摘要
我们提出 Exemplar Partitioning(EP),一种从大语言模型激活构建可解释特征字典的无监督方法,其标记数比可比稀疏自编码器(SAE)少约 倍。EP 字典是激活空间的 Voronoi 分区,通过在距离阈值内对流式激活进行领袖聚类构建。每个区域都由观察到的示例锚定,既作为其成员资格标准,也作为干预方向;字典大小无需预设,而是由该阈值下的激活几何决定。由于示例是观察得到的而非学习得到的,因此来自相同数据流构建的字典在不同层、不同模型及不同训练检查点之间直接可比较。我们通过针对该构造新获得的属性进行有针对性的演示,以及一项头盼基准,来表征 EP 作为一种解释性对象。Gemma-2-2B 中,EP 字典区域具有可解释性并支持因果干预:在指令调优 Gemma 中,拒绝行为集中于一个区域,其示例删减可导致拒绝行为的崩溃。跨检查点匹配将基座模型与指令调优模型的字典区分开来,从而分离出通过微调保留的方向与由此引入的方向。EP 区域与 Gemma Scope SAE 特征在分解激活空间方面不同,但在共享核心方面达成一致:约 的 EP 区域在 时匹配某个 SAE 特征,EP 单热门户保留约 的原始激活探测准确度,仅需 。最近示例距离为推理时的免费离群信号。AxBench 在 Gemma-2-2B-it L20 上进行的潜在概念检测显示,EP 在 处达到平均 AUROC 0.881,较规范 GemmaScope SAE 排行榜条目高出 0.126,仅略低于 SAE-A 的 0.911,同时构建计算成本约为其 倍。
关键词
引用
@article{arxiv.2605.14347,
title = {Exemplar Partitioning for Mechanistic Interpretability},
author = {Jessica Rumbelow},
journal= {arXiv preprint arXiv:2605.14347},
year = {2026}
}
备注
Code: https://github.com/jessicarumbelow/exemplar-partitioning. Pretrained dictionaries: https://huggingface.co/datasets/J-RUM/exemplar-partitioning