针对干净标签后门攻击污染图神经网络的内部预测逻辑
机器学习
2026-04-15 v2 人工智能
摘要
图神经网络(GNN)在各种任务中取得了显著的成绩。最近的研究表明,图后门攻击可以污染 GNN 模型,以便在测试节点附加触发器时预测为目标类。然而,除了向训练节点注入触发器外,这些图后门攻击通常需要将触发器附加的训练节点的标签更改为目标类,这在现实场景中是不实际的。在本工作中,我们关注干净标签图后门攻击,即训练标签不可修改的情形,这是一种真实但鲜有人研究的主题。根据我们的初步分析,现有的图后门攻击在干净标签设置下通常会失败。我们的进一步分析识别出现有方法的核心失败在于它们无法污染 GNN 模型的预测逻辑,导致触发器被视为预测中不重要的因素。因此,我们研究了通过污染 GNN 模型的内部预测逻辑来实现有效的干净标签图后门攻击的问题。我们提出了 BA-Logic 来解决该问题,通过协调受污染节点选择器和逻辑污染触发器生成器。大量实验在真实数据集上表明,我们的方法有效地提高了攻击成功率,并在干净标签设置下超越了最先进的图后门攻击竞争对手。我们的代码可在 https://anonymous.4open.science/r/BA-Logic 获取。
引用
@article{arxiv.2603.05004,
title = {Poisoning the Inner Prediction Logic of Graph Neural Networks for Clean-Label Backdoor Attacks},
author = {Yuxiang Zhang and Bin Ma and Enyan Dai},
journal= {arXiv preprint arXiv:2603.05004},
year = {2026}
}
备注
Under review as TMLR regular paper