中文

PLOT:神经因果抽象中基于最优传输的渐进式定位

机器学习 2026-05-11 v1 人工智能 机器学习

摘要

因果抽象为机制可解释性提供了一个有原则的框架,通过反事实干预分析将高级因果模型与神经网络实现的低级计算对齐。现有方法如分布式对齐搜索 (DAS) 能够学习富有表达力的子空间干预,但相关的神经位点是先验未知的,因此寻找控制变量需要对候选位点进行计算负担沉重的搜索。我们引入了 PLOT (Progressive Localization via Optimal Transport),一个基于传输的框架,它从抽象干预和神经干预的输出效应几何中定位因果变量。PLOT 在抽象变量和候选神经位点之间拟合最优传输耦合,产生一个全局软对应关系,该校准后可作为干预控制变量。在简单设定中,对单个神经元的单一耦合即可满足要求。在更大模型中,PLOT 被渐进式应用,从粗粒度位点(如 token、时间步或层)移动到更细粒度的支撑(如坐标组或 PCA 张成),并可选地基于定位信号引导 DAS。在复杂度递增的实验中,仅基于传输的 PLOT 控制变量速度极快且在精度上具竞争力,而 PLOT 引导的 DAS 以一小部分的完整 DAS 运行时间达到了 DAS 级别的精度,为大规模因果抽象研究提供了高效的定位引擎。

关键词

引用

@article{arxiv.2605.06979,
  title  = {PLOT: Progressive Localization via Optimal Transport in Neural Causal Abstraction},
  author = {Jonathn Chang and Arya Datla and Ziv Goldfeld},
  journal= {arXiv preprint arXiv:2605.06979},
  year   = {2026}
}