GNN 解释并非解释及其发现方法
机器学习
2026-03-03 v3 人工智能
摘要
自解释型图神经网络 (SE-GNN) 提供的解释对于理解模型内部工作机制以及识别敏感属性潜在滥用至关重要。尽管近期研究指出这些解释可能次优且误导性,但尚无对其失效情形的系统性描述。本文识别了 SE-GNN 解释的一个关键失效模式:解释与 SE-GNN 推断标签的方式无关。我们表明,一方面,许多 SE-GNN 能够在产生这些退化解释的同时实现最优的真实风险,另一方面,大多数忠诚度指标都无法识别这些失效模式。我们的实证分析表明,退化解释既可能被恶意植入(允许攻击者隐藏对敏感属性的使用),也可能自然出现,这凸显了可靠审计的必要性。为此,我们引入一种新型忠诚度指标,能够可靠地将退化解释标记为不忠实,无论是恶意情境还是自然情境。我们的代码已公开于 https://github.com/steveazzolin/gnn_deg_expl。
引用
@article{arxiv.2601.20815,
title = {GNN Explanations that do not Explain and How to find Them},
author = {Steve Azzolin and Stefano Teso and Bruno Lepri and Andrea Passerini and Sagar Malhotra},
journal= {arXiv preprint arXiv:2601.20815},
year = {2026}
}
备注
Accepted at ICLR26 + added GitHub link