图通用对抗攻击:少数坏节点毁掉图学习模型
机器学习
2021-06-24 v2 密码学与安全
社会与信息网络
机器学习
摘要
深度神经网络虽泛化良好,但已知对微小对抗扰动敏感。该现象构成严重安全威胁,并呼吁深入探究深度学习模型的鲁棒性。随着图结构数据神经网络的出现,类似研究亟待开展以理解其鲁棒性。已发现对抗性地扰动图结构和/或节点特征可能导致模型性能显著下降。本文从另一角度表明,若图中包含少数坏节点,同样会发生此类脆弱性,这些节点通过翻转与任意目标受害者的连接来破坏训练好的图神经网络。更糟的是,为一个图模型找到的坏节点也会严重破坏其他模型。我们将这些坏节点称为“锚节点”,并提出一种名为 GUA 的算法来识别它们。充分的实证研究发现一个有趣现象:锚节点常属于同一类;同时也证实了锚节点数量与攻击成功率之间直观的权衡关系。对于含 2708 个节点的 Cora 数据集,少至六个锚节点就会使 GCN 及其他三种模型的攻击成功率高于 80%。
引用
@article{arxiv.2002.04784,
title = {Graph Universal Adversarial Attacks: A Few Bad Actors Ruin Graph Learning Models},
author = {Xiao Zang and Yi Xie and Jie Chen and Bo Yuan},
journal= {arXiv preprint arXiv:2002.04784},
year = {2021}
}
备注
IJCAI 2021. Code is available at https://github.com/chisam0217/Graph-Universal-Attack