结合后门与对抗样本的神经网络分类器协同攻击
密码学与安全
2021-09-06 v1 机器学习
摘要
本工作中,我们展示如何联合利用对抗扰动与模型投毒漏洞,实际发起一种名为AdvTrojan的新型隐蔽攻击。AdvTrojan具有隐蔽性,因为它仅当以下条件同时满足时才可被激活:1) 在推理阶段向输入样本注入精心构造的对抗扰动;2) 在模型训练过程中植入Trojan后门。我们利用输入空间中的对抗噪声将受Trojan感染的样本移过模型决策边界,使其难以被检测。AdvTrojan的隐蔽行为欺骗用户,使其误以为受感染模型是针对对抗样本鲁棒的分类器。AdvTrojan可仅通过投毒训练数据来实现,类似于传统的Trojan后门攻击。我们对多个基准数据集的深入分析与大量实验表明,AdvTrojan在多数实验场景下能以接近100%的成功率绕过现有防御,并且也可扩展用于攻击联邦学习任务。
引用
@article{arxiv.2109.01275,
title = {A Synergetic Attack against Neural Network Classifiers combining Backdoor and Adversarial Examples},
author = {Guanxiong Liu and Issa Khalil and Abdallah Khreishah and NhatHai Phan},
journal= {arXiv preprint arXiv:2109.01275},
year = {2021}
}