中文

在数据有限时,微调并非黄金方案:通过 GRAPHNAD 缓解图神经网络中的后门攻击

机器学习 2025-01-13 v1 密码学与安全

摘要

图神经网络 (GNN) 由于其信息传递机制,已取得显著性性能。然而,近期研究表明 GNN 对后门攻击极其脆弱,后门攻击可导致附加触发器的图被误分类为目标类别。近期有前景的防御技术(如微调或蒸馏)的有效性严重依赖于充分的训练数据集。经验研究表明,微调方法需要约 20% 的干净数据才能将攻击准确率降至 25% 以下,而蒸馏方法需要约 15% 的干净数据。然而,获取如此大量干净数据在实际中往往不可行。本文提出一种实用的后门缓解框架,称为 GRAPHNAD,它能够在 GNN 中捕获高质量的中间层表示,以有限的干净数据增强蒸馏过程。为此,我们回答了以下关键问题:如何为蒸馏识别图中合适的注意力表示?如何在有限数据下提升蒸馏效果?通过采用图注意力传递方法,GRAPHNAD 能够有效地将后门模型的中间层注意力表示与教师模型一致,从而迫使后门神经元转化为良性神经元。此外,我们从中间层转换中提取关系图,并强制后门模型的关系图与教师模型一致,从而在确保模型准确性的同时进一步降低后门的影响。大量实验结果表明,仅通过对教师模型进行 3% 的干净数据微调,GRAPHNAD 即可将攻击成功率降至 5% 以下。

关键词

引用

@article{arxiv.2501.05835,
  title  = {Fine-tuning is Not Fine: Mitigating Backdoor Attacks in GNNs with Limited Clean Data},
  author = {Jiale Zhang and Bosen Rao and Chengcheng Zhu and Xiaobing Sun and Qingming Li and Haibo Hu and Xiapu Luo and Qingqing Ye and Shouling Ji},
  journal= {arXiv preprint arXiv:2501.05835},
  year   = {2025}
}