图神经网络解释器是脆弱的
密码学与安全
2024-06-06 v1 机器学习
摘要
可解释图神经网络(GNN)最近兴起,旨在增强使用GNN的信任。现有的GNN解释器从不同角度开发以提升解释性能。我们首次研究GNN解释器在对抗攻击下的表现——我们发现,对手轻微扰动图结构可以确保GNN模型做出正确预测,但GNN解释器在扰动图上产生截然不同的解释。具体来说,我们首先在实用的威胁模型下(即对手对GNN解释器的了解有限且扰动预算受限)形式化攻击问题。然后我们设计了两种方法(一种基于损失,另一种基于推导)来实现攻击。我们在各种GNN解释器上评估了我们的攻击,结果表明这些解释器是脆弱的。
引用
@article{arxiv.2406.03193,
title = {Graph Neural Network Explanations are Fragile},
author = {Jiate Li and Meng Pang and Yun Dong and Jinyuan Jia and Binghui Wang},
journal= {arXiv preprint arXiv:2406.03193},
year = {2024}
}
备注
17 pages, 64 figures