InterpBench:用于评估机制可解释性技术的半合成Transformer模型
机器学习
2025-10-14 v3
摘要
机制可解释性方法旨在识别神经网络实现的算法,但当真实算法未知时,验证此类方法十分困难。本文提出了InterpBench,一个包含已知电路且半合成但逼真的Transformer集合,用于评估这些技术。我们使用一种更严格的交换干预训练(IIT)版本(我们称之为严格IIT(SIIT))来训练简单的神经网络。与原始方法一样,SIIT通过将其内部计算与期望的高级因果模型对齐来训练神经网络,但它也阻止非电路节点影响模型的输出。我们在由Tracr工具生成的稀疏Transformer上评估了SIIT,发现SIIT模型在保持Tracr原始电路的同时更加逼真。SIIT还可以训练具有更大电路的Transformer,例如间接宾语识别(IOI)。最后,我们使用我们的基准来评估现有的电路发现技术。
引用
@article{arxiv.2407.14494,
title = {InterpBench: Semi-Synthetic Transformers for Evaluating Mechanistic Interpretability Techniques},
author = {Rohan Gupta and Iván Arcuschin and Thomas Kwa and Adrià Garriga-Alonso},
journal= {arXiv preprint arXiv:2407.14494},
year = {2025}
}
备注
Published at the 38th Conference on Neural Information Processing Systems (NeurIPS 2024) Track on Datasets and Benchmarks