中文

图神经网络的后门攻击检测与缓解

密码学与安全 2024-10-21 v1 机器学习

摘要

近期研究表明,图神经网络(GNN)高度易受多种对抗性攻击。其中,图后门攻击是最突出的威胁之一,攻击者在训练阶段通过注入触发器并修改目标标签来学习背后的特征,从而导致模型误分类。基于触发器的特征,这些攻击可分为分布外(OOD)和分布内(ID)图后门攻击,触发器与干净样本特征分布差异显著的构成 OOD 后门攻击,而 ID 后门攻击的触发器几乎与干净样本特征分布相同。现有方法可成功防御 OOD 后门攻击,通过比较触发器和干净样本的特征分布,但无法缓解隐蔽的 ID 后门攻击。由于缺乏适当的监督信号,在防御 ID 后门攻击时,主要任务准确率会受到负面影响。为弥合这一差距,我们提出了 DMGNN 来防御 OOD 和 ID 图后门攻击,能够强大的消除隐蔽性以保证防御有效性并提高模型性能。具体而言,DMGNN 可通过基于反事实解释预测标签转换来轻松识别隐藏的 ID 和 OOD 触发器。进一步通过反采样修剪方法在数据层面筛选并丢弃触发器,以进一步过滤生成的可解释图的多样性并抹去触发器特征的影响。在开放图数据集上的大量实验评估表明,DMGNN 远超当前最先进(SOTA)防御方法,在几乎不损失模型性能(仅限 3.5%)的情况下,将攻击成功率降至 5%。

关键词

引用

@article{arxiv.2410.14105,
  title  = {DMGNN: Detecting and Mitigating Backdoor Attacks in Graph Neural Networks},
  author = {Hao Sui and Bing Chen and Jiale Zhang and Chengcheng Zhu and Di Wu and Qinghua Lu and Guodong Long},
  journal= {arXiv preprint arXiv:2410.14105},
  year   = {2024}
}

备注

12 pages, 8 figures