中文

语义对抗样本

计算机视觉与模式识别 2018-04-03 v1 人工智能 机器学习

摘要

深度神经网络已知易受对抗样本的攻击,即被恶意扰动以欺骗模型的图像。生成对抗样本大多局限于寻找使模型预测误差最大的微小扰动。然而,此类图像包含人为扰动,使其与自然图像有一定可区分性。若干防御方法利用该性质,通过应用去噪滤波或训练模型对微小扰动鲁棒来应对对抗样本。本文引入一类新的对抗样本,即“语义对抗样本”,指被任意扰动以欺骗模型、但修改后图像在语义上仍表示与原始图像相同物体的图像。我们将生成此类图像的问题表述为约束优化问题,并基于人类认知系统的形状偏置性质开发了对抗变换。在我们的方法中,首先将RGB图像转换到HSV(色调、饱和度、明度)色彩空间,然后随机偏移色调与饱和度分量,同时保持明度分量不变,从而生成对抗图像。我们在CIFAR10数据集上的实验结果表明,VGG16网络在对抗性色彩偏移图像上的准确率为5.7%。

关键词

引用

@article{arxiv.1804.00499,
  title  = {Semantic Adversarial Examples},
  author = {Hossein Hosseini and Radha Poovendran},
  journal= {arXiv preprint arXiv:1804.00499},
  year   = {2018}
}