在图神经网络训练中识别后门图:一种基于解释的新颖指标方法
机器学习
2026-05-12 v3 人工智能
摘要
图神经网络(GNN)在许多领域越来越受欢迎,但它们容易受到后门攻击,这可能会损害其性能和道德应用。检测这些攻击对于维护GNN分类任务的可靠性和安全性至关重要,但现有方法通常不灵活,依赖单一指标,无法捕捉后门行为的全部范围。认识到检测此类入侵的挑战,我们设计了一种新颖的检测方法,创造性地利用了图级解释。通过提取和转换GNN解释机制的次级输出,我们开发了七种创新指标,用于有效检测GNN上的后门攻击。此外,我们开发了一种自适应攻击来严格评估我们的方法。我们在多个基准数据集上测试了我们的方法,并检查了其针对各种攻击模型的有效性。结果表明,我们的方法可以实现高检测性能,标志着在保护GNN免受后门攻击方面取得了重大进展。
引用
@article{arxiv.2403.18136,
title = {Identifying Backdoored Graphs in Graph Neural Network Training: An Explanation-Based Approach with Novel Metrics},
author = {Jane Downer and Ren Wang and Binghui Wang},
journal= {arXiv preprint arXiv:2403.18136},
year = {2026}
}