用于反事实可解释性的图逆风格迁移
机器学习
2025-07-08 v2
摘要
反事实可解释性旨在通过识别改变预测结果所需的最小输入变化来揭示模型决策。该任务在图数据上尤为具有挑战性,因为需要保持结构完整性与语义含义。与依赖前向扰动机制的先前方法不同,我们提出了图逆风格迁移(GIST),这是首个将图反事实生成重新构想为回溯过程的框架,利用谱风格迁移。通过将全局结构与原始输入谱对齐并保持局部内容保真度,GIST 将反事实结果生成为输入风格与反事实内容之间的有效插值。在 8 个二分类和多类图分类基准数据集上的测试表明,GIST 在生成反事实结果的有效性上实现了 +7.6% 的显著提升,并在忠实解释真实类别分布方面取得了 +45.5% 的显著增益。此外,GIST 的回溯机制有效缓解了对底层预测器决策边界的过度超越,最小化了输入与反事实结果之间的谱差异。这些结果挑战了传统的前向扰动方法,提供了一个推进图可解释性的新视角。
引用
@article{arxiv.2505.17542,
title = {Graph Inverse Style Transfer for Counterfactual Explainability},
author = {Bardh Prenkaj and Efstratios Zaradoukas and Gjergji Kasneci},
journal= {arXiv preprint arXiv:2505.17542},
year = {2025}
}
备注
Accepted to ICML'25