用于生成通用对抗扰动的可泛化无数据目标函数
计算机视觉与模式识别
2018-07-25 v3 人工智能
机器学习
摘要
机器学习模型易受对抗扰动的攻击:对输入的微小改动可能导致输出的巨大变化。已有研究还表明,存在与输入无关的扰动,称为通用对抗扰动(universal adversarial perturbations),其能够改变目标模型在绝大多数数据样本上的推断结果。然而,现有的通用扰动生成方法存在以下不足:(i) 任务特定;(ii) 需要来自训练数据分布的样本;(iii) 执行复杂的优化。此外,由于对数据的依赖,所生成扰动的欺骗能力与可用的训练数据量成正比。本文提出一种新颖、可泛化且无数据的通用对抗扰动生成方法。我们的目标函数独立于底层任务,通过破坏多层提取的特征来实现欺骗。因此,该目标函数可泛化地生成跨多种视觉任务(如目标识别、语义分割和深度估计)的图像无关扰动。在黑盒攻击场景的实际设定下(攻击者无法访问目标模型及其训练数据),我们表明我们的目标函数在欺骗所学模型方面优于依赖数据的目标函数。此外,通过利用与数据分布相关的简单先验,我们的目标函数显著提升了所生成扰动的欺骗能力。我们的目标函数所取得的显著欺骗率强调,当前的深度学习模型面临更高的风险,因为我们的目标函数可跨多个任务泛化,且无需训练数据来生成扰动。为了鼓励可复现研究,我们已发布所提算法的代码。
引用
@article{arxiv.1801.08092,
title = {Generalizable Data-free Objective for Crafting Universal Adversarial Perturbations},
author = {Konda Reddy Mopuri and Aditya Ganeshan and R. Venkatesh Babu},
journal= {arXiv preprint arXiv:1801.08092},
year = {2018}
}
备注
TPAMI | Repository: https://github.com/val-iisc/GD-UAP