通过特征操控生成语义对抗样本
机器学习
2022-05-23 v2 密码学与安全
机器学习
摘要
深度神经网络对对抗攻击的脆弱性已被广泛证明(如对抗样本攻击)。传统攻击执行非结构化的逐像素扰动以欺骗分类器。另一种方法是在潜空间中进行扰动。然而,由于缺乏可解释性与解耦性,此类扰动难以控制。本文中,我们提出一种更实用的对抗攻击,通过设计具有语义意义的结构化扰动实现。我们提出的技术通过解耦的潜码操控图像的语义属性。该技术背后的直觉是:相似域中的图像具有一些共同共享但与主题无关的语义属性,例如手写数字中线条的粗细,这些属性可双向映射到解耦潜码。我们通过操控这些潜码中的单个或组合来生成对抗扰动,并针对潜码的复杂性与重建图像的平滑性,提出两种无监督语义操控方法:基于向量的解耦表示与基于特征图的解耦表示。我们在真实世界图像数据上进行广泛的实验评估,以证明我们的攻击对黑盒分类器的威力。我们进一步证明了一种通用的、与图像无关的语义对抗样本的存在。
引用
@article{arxiv.2001.02297,
title = {Generating Semantic Adversarial Examples via Feature Manipulation},
author = {Shuo Wang and Surya Nepal and Carsten Rudolph and Marthie Grobler and Shangyu Chen and Tianle Chen},
journal= {arXiv preprint arXiv:2001.02297},
year = {2022}
}
备注
arXiv admin note: substantial text overlap with arXiv:1705.09064 by other authors