BlackboxNLP-2025 MIB 共享任务:通过更好的边缘选择提高电路忠实性
计算与语言
2025-10-31 v1 人工智能
摘要
机械可解释性中的一个主要挑战是电路发现,即确定模型中哪些部分执行给定任务。我们在 Mechanistic Interpretability Benchmark (MIB) 基础上进行拓展,提出了三项对电路发现的关键改进:(1) 使用自助法识别具有一致归因分数的边;(2) 引入一种基于比率的选择策略,以优先选择强正向评分的边,平衡性能和忠实性;(3) 将标准的贪心选择方法替换为整数线性规划表述。我们的方法获得了更忠实的电路,并在多个 MIB 任务和模型上超越了先前方法。我们的代码可在 https://github.com/technion-cs-nlp/MIB-Shared-Task 上获取。
引用
@article{arxiv.2510.25786,
title = {BlackboxNLP-2025 MIB Shared Task: Improving Circuit Faithfulness via Better Edge Selection},
author = {Yaniv Nikankin and Dana Arad and Itay Itzhak and Anja Reusch and Adi Simhi and Gal Kesten-Pomeranz and Yonatan Belinkov},
journal= {arXiv preprint arXiv:2510.25786},
year = {2025}
}