生成具有可控不可迁移性的对抗样本
密码学与安全
2020-09-29 v2
摘要
针对深度神经网络的对抗攻击已被广泛研究。使此类攻击特别强大的一个显著特征是迁移性,即从一个模型生成的对抗样本也能有效攻击其他类似模型。已有大量工作致力于提高迁移性。然而,如何降低迁移性并仅为特定目标模型制作恶意样本尚未被探索。在本文中,我们设计了新颖的攻击方法来生成具有可控不可迁移性的对抗样本。通过这些方法,攻击者可以高效地生成精确的对抗样本,以攻击他所期望的一组目标模型,同时保持对其他模型无害。第一种方法是反向损失函数集成,攻击者可以从反向损失函数的梯度中制作合格的样本。这种方法适用于白盒和灰盒设置。第二种方法是迁移性分类:攻击者从对抗样本的扰动中训练一个具有迁移性感知能力的分类器。该分类器进一步为生成不可迁移的对抗样本提供指导。这种方法可以应用于黑盒场景。评估结果证明了我们提出方法的有效性和效率。这项工作为生成具有新特征和新应用的对抗样本开辟了一条新途径。
引用
@article{arxiv.2007.01299,
title = {Generating Adversarial Examples with Controllable Non-transferability},
author = {Renzhi Wang and Tianwei Zhang and Xiaofei Xie and Lei Ma and Cong Tian and Felix Juefei-Xu and Yang Liu},
journal= {arXiv preprint arXiv:2007.01299},
year = {2020}
}