针对图神经网络的机器遗忘逆向攻击
机器学习
2025-12-09 v2 人工智能
密码学与安全
摘要
图机器遗忘方法旨在无需完整重训练的情况下,从训练好的 GNNs 中高效移除敏感数据的影响,其假设是被删除的信息无法被恢复。在本工作中,我们通过引入图机器遗忘逆向攻击来挑战这一假设:在仅拥有对已遗忘 GNN 的黑盒访问权限和部分图知识的情况下,对手能否重建被移除的边?我们识别出两个关键挑战:已遗忘边与保留边的概率相似度阈值存在差异,以及定位已遗忘边端点的困难,并用 TrendAttack 解决了它们。首先,我们推导并利用了置信度陷阱,这是一种理论和经验模式,表明与已遗忘边相邻的节点在模型置信度上出现大幅下降。其次,我们设计了一种自适应预测机制,对已遗忘边和其他成员边应用不同的相似度阈值。我们的框架灵活集成了现有的成员推理技术,并用趋势特征对其进行了扩展。在四个真实世界数据集上的实验表明,TrendAttack 显著优于最先进的 GNN 成员推理基线,暴露了当前图机器遗忘方法中存在的严重隐私漏洞。
引用
@article{arxiv.2506.00808,
title = {Unlearning Inversion Attacks for Graph Neural Networks},
author = {Jiahao Zhang and Yilong Wang and Zhiwei Zhang and Xiaorui Liu and Suhang Wang},
journal= {arXiv preprint arXiv:2506.00808},
year = {2025}
}