中文

利用可解释性防御图神经网络上的后门攻击

人工智能 2022-09-08 v1

摘要

后门攻击是针对深度学习模型的一种强力攻击算法。近来,GNN易受后门攻击的脆弱性已在图分类任务上得到证明。本文中,我们提出了首个针对GNN的后门检测与防御方法。大多数后门攻击依赖于向干净样本注入微小但有影响的触发器。对于图数据,当前后门攻击聚焦于操纵图结构以注入触发器。我们发现,在一些解释性评估指标(如保真度和不保真度)上,良性样本与恶意样本之间存在明显差异。在识别出恶意样本后,GNN模型的可解释性可帮助我们捕获最可能作为木马图中触发器的显著子图。我们使用多种数据集和不同攻击设置来证明我们防御方法的有效性。攻击成功率均大幅下降。

关键词

引用

@article{arxiv.2209.02902,
  title  = {Defending Against Backdoor Attack on Graph Nerual Network by Explainability},
  author = {Bingchen Jiang and Zhao Li},
  journal= {arXiv preprint arXiv:2209.02902},
  year   = {2022}
}

备注

10 pages, 10 figures