BlackboxNLP 2025共享任务发现:在语言模型中局部电路与因果变量
计算与语言
2025-11-25 v1 人工智能
摘要
机械可解释性 (MI) 旨在揭示语言模型 (LM) 如何实现特定行为,但衡量 MI 进展仍具有挑战性。最近发布的机械可解释性基准 (MIB; Mueller 等,2025) 提供了用于评估电路和因果变量局部化的标准化框架。基于此基础上,BlackboxNLP 2025 共享任务将 MIB 扩展为社区范围内的可重复比较。共享任务包含两个轨道:一个用于评估识别驱动模型行为的因果影响组件和相互作用的电路局部化方法,另一个用于评估将激活映射到可解释特征的因果变量局部化方法。该共享任务吸引了三支队伍、八种不同方法的参赛者,在电路局部化方面实现了显著提升,主要通过集成和正则化策略来实现电路发现。在因果变量局部化方面,吸引了一支队伓两种方法的参赛者,通过低维和非线性投影来对激活向量进行特征化,从而实现显著提升。MIB 排行榜仍开放进行中;我们鼓励在该标准评估框架下继续工作,以衡量 MI 研究的进展。
引用
@article{arxiv.2511.18409,
title = {Findings of the BlackboxNLP 2025 Shared Task: Localizing Circuits and Causal Variables in Language Models},
author = {Dana Arad and Yonatan Belinkov and Hanjie Chen and Najoung Kim and Hosein Mohebbi and Aaron Mueller and Gabriele Sarti and Martin Tutek},
journal= {arXiv preprint arXiv:2511.18409},
year = {2025}
}