通过贝叶斯优化对图分类发起对抗攻击
机器学习
2021-11-05 v1 人工智能
密码学与安全
机器学习
摘要
图神经网络是一类在广泛的基于图的学习任务中非常有效的流行模型,已被证明容易受到对抗攻击。尽管大部分文献关注节点级分类任务中的此类脆弱性,但很少有工作致力于分析图级分类的对抗攻击,而这是一个在生物化学和社交网络分析等众多现实应用中的重要问题。现有的少数方法通常需要不切实际的设置,例如访问受害模型的内部信息,或数量不切实际的大量查询。我们提出了一种基于贝叶斯优化的图分类模型攻击新方法。我们的方法是黑盒的、查询高效的,并且对所施加的扰动很节约。我们在涉及不同图属性、约束和攻击模式的广泛图分类任务上,实证验证了所提方法的有效性和灵活性。最后,我们分析了所生成对抗样本背后的常见可解释模式,这可能为图分类模型的对抗鲁棒性提供进一步的启示。
引用
@article{arxiv.2111.02842,
title = {Adversarial Attacks on Graph Classification via Bayesian Optimisation},
author = {Xingchen Wan and Henry Kenlay and Binxin Ru and Arno Blaas and Michael A. Osborne and Xiaowen Dong},
journal= {arXiv preprint arXiv:2111.02842},
year = {2021}
}
备注
NeurIPS 2021. 11 pages, 8 figures, 2 tables (24 pages, 17 figures, 8 tables including references and appendices)