中文

“无论你做什么”:通过背door 遗忘净化 GNN 模型

密码学与安全 2024-11-14 v2 机器学习

摘要

最近的研究揭示了 GNN 面临多种对抗性攻击,其中一种是最棘手的背door 攻击。类似于深度神经网络 (DNN),GNN 中的背door 攻击的本质在于攻击者通过嵌入触发器修改部分图数据,迫使模型在训练过程中学习触发器特征。尽管 DNN 领域已有大量背door 防御工作,但针对 GNN 的背door 防御研究仍寥寥,严重阻碍了 GNN 在实际任务中的广泛应用。为填补这一空白,我们提出了 GCleaner——首个针对 GNN 的背door 防御方法。GCleaner 通过逆转背door 学习过程来消除背door 逻辑,旨在恢复模型性能,使其接近直接在原始干净数据集上训练的水平。为实现此目标,我们提出:如何在 GNN 中恢复通用且难以发现的背door 触发器?如何在保持模型性能的前提下遗忘背door 触发器特征?我们通过解释方法进行图形触发器恢复,以识别最佳触发器位置,借此通过最大相似性在背door 模型特征空间中搜索通用且难以发现的背door 触发器。随后,我们引入背door 遗忘机制,将知识蒸馏与基于梯度的可解释知识相结合,以实现精细化的背door 抹除。广泛的实验评估表明,GCleaner 仅需 1% 的干净数据,即可将背door 攻击成功率降至约 10%,且对模型性能几乎没有负面影响,远超当前最先进 (SOTA) 防御方法。

关键词

引用

@article{arxiv.2410.01272,
  title  = {"No Matter What You Do": Purifying GNN Models via Backdoor Unlearning},
  author = {Jiale Zhang and Chengcheng Zhu and Bosen Rao and Hao Sui and Xiaobing Sun and Bing Chen and Chunyi Zhou and Shouling Ji},
  journal= {arXiv preprint arXiv:2410.01272},
  year   = {2024}
}

备注

18 pages, 12 figures, 9 tables