中文

挑选良好苹果:诊断与改进因果抽象的一种方法

人工智能 2026-05-05 v1 计算与语言

摘要

我们提出了一种诊断神经网络解释的方法,通过识别其中一种被假设解释高度忠实的输入子空间。该方法在因果抽象风格的解释性问题中尤其有用,即通过交叉干预来评估高层因果假设。我们通过根据两两交叉干预行为,将输入空间划分为被正确解释和未被正确解释的区域来细化这一框架。这将因果抽象从纯粹的全局评估转变为更具诊断性的工具:它不仅测量一种解释是否有效,还揭示了哪些地方有效、哪些地方失败,以及两者的区别。这种诊断性视角还提供了实用性的改进解释的启发式方法。通过分析被正确解释区域和未被正确解释区域的结构,我们可以识别高层假设中缺失的区分,发现此前未建模的中间变量,并将互补的部分解释组合成更强的解释。我们将其实例化为一个简单的四步流程,并在多种因果抽象情境中显示其能产生有信息的错误分析。在一个 toy 逻辑任务中,递归地应用该流程可从头开始恢复高层假设。更广泛地说,我们的结果表明,对输入空间进行分区是通向更精确、更具构造性和更可扩展的机制解释的有用步骤。

关键词

引用

@article{arxiv.2605.02234,
  title  = {Bucketing the Good Apples: A Method for Diagnosing and Improving Causal Abstraction},
  author = {Li Puyin and Jiyuan Tan and Ahmad Jabbar and Thomas Icard and Atticus Geiger},
  journal= {arXiv preprint arXiv:2605.02234},
  year   = {2026}
}