中文

修剪、解释、评估:面向高效电路发现的跨层 transcoder-native 框架

计算与语言 2026-05-11 v2

摘要

现有的特征解释管道通常在均匀抽样的单元或穷举特征集上运行,导致对与目标行为无关的单元产生巨大的计算成本。为此,我们引入首个CLT-native端到端修剪框架PIE,开创了先修剪后解释的范式。PIE将Pruning、自动Interpretation和解释Evaluation连接起来,构建了一个系统化的基准环境,旨在系统测量在修剪后的行为保真度和下游解释性。我们在此框架中适配了强大的相关性基线方法,提出了特征属性修补 (FAP),这是一种以 patch 为基础的属性方法,通过聚合梯度加权写入贡献来评分CLT特征。此外,我们引入FAP-Synergy,一种系统化的协同效应感知reranking程序。我们使用KL散度行为保留和基于 FADE 的指标评估修剪效果,分别在IOI和Doc-String数据集上评估解释质量。在K取{50, 100, 200, 400, 800}的预算约束下,我们的严谨基准测试揭示了不同的操作 regime:虽然基本FAP和适配基线在宽松预算下表现稳健,但FAP-Synergy在高度受限的严格预算 regime 中表现卓越。关键的是,我们演示了一种实际的“有效预算”优势:在Llama-3.2-1B和Gemma-2-2B上的IOI任务中,FAP-Synergy在K=50时,功能上等效于基线电路在K=75的行为保真度。由于下游评估成本按特征线性比例增长,Synergy实际上为管道节省了25个“免费”特征,在降低解释成本33%的同时,达到K=75的保真度效果。

关键词

引用

@article{arxiv.2604.16889,
  title  = {Prune, Interpret, Evaluate: A Cross-Layer Transcoder-Native Framework for Efficient Circuit Discovery via Feature Attribution},
  author = {Qinhao Chen and Linyang He and Nima Mesgarani},
  journal= {arXiv preprint arXiv:2604.16889},
  year   = {2026}
}