中文

InterpBench:用于评估机制可解释性技术的半合成Transformer模型

机器学习 2025-10-14 v3

摘要

机制可解释性方法旨在识别神经网络实现的算法,但当真实算法未知时,验证此类方法十分困难。本文提出了InterpBench,一个包含已知电路且半合成但逼真的Transformer集合,用于评估这些技术。我们使用一种更严格的交换干预训练(IIT)版本(我们称之为严格IIT(SIIT))来训练简单的神经网络。与原始方法一样,SIIT通过将其内部计算与期望的高级因果模型对齐来训练神经网络,但它也阻止非电路节点影响模型的输出。我们在由Tracr工具生成的稀疏Transformer上评估了SIIT,发现SIIT模型在保持Tracr原始电路的同时更加逼真。SIIT还可以训练具有更大电路的Transformer,例如间接宾语识别(IOI)。最后,我们使用我们的基准来评估现有的电路发现技术。

引用

@article{arxiv.2407.14494,
  title  = {InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques},
  author = {Rohan Gupta and Iván Arcuschin and Thomas Kwa and Adrià Garriga-Alonso},
  journal= {arXiv preprint arXiv:2407.14494},
  year   = {2025}
}

备注

Published at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks