结合因果模型以获得更准确的神经网络抽象
机器学习
2025-03-17 v1 人工智能
摘要
机制可解释性旨在通过揭示神经网络实现了哪些高层算法来对其进行逆向工程。因果抽象提供了一种关于网络何时实现算法的精确概念,即网络的因果模型包含实现算法因果模型中高层变量的低层特征。在实际环境中,一个典型问题是算法并非网络完全忠实的抽象,这意味着它仅部分捕获了模型的真实推理过程。我们提出了一种解决方案,将不同的简单高层模型结合起来,以产生对网络更忠实的表示。通过学习这种组合,我们可以将神经网络建模为根据所提供的输入处于不同的计算状态,我们展示了这对于在两个玩具任务上微调的 GPT 2-small 更为准确。我们观察到可解释性假设的强度(我们用高层模型解释的输入数量来定义)与其忠实度(我们定义为互换干预准确率)之间存在权衡。我们的方法允许我们在两者之间进行调节,提供了在给定忠实度水平下描述神经网络行为的最准确模型组合。
引用
@article{arxiv.2503.11429,
title = {Combining Causal Models for More Accurate Abstractions of Neural Networks},
author = {Theodora-Mara Pîslar and Sara Magliacane and Atticus Geiger},
journal= {arXiv preprint arXiv:2503.11429},
year = {2025}
}