基于概念的对抗攻击:同时欺骗人类与分类器
机器学习
2022-03-22 v1 密码学与安全
计算机视觉与模式识别
摘要
我们提出通过修改编码语义上有意义概念的上层激活值来生成对抗样本。通过使用修改后的激活值重建原始样本,将原始样本向目标样本偏移,从而产生对抗样本。人类可能(并且可能应该)注意到原始样本和对抗样本之间的差异。根据攻击者提供的约束条件,对抗样本可以表现出细微的差异,或者看起来像是来自另一个类别的“伪造”样本。我们的方法和目标与涉及人类无法识别的单像素扰动的常见攻击形成鲜明对比。我们的方法适用于例如输入的多阶段处理,其中人类和机器都参与决策,因为不可见的扰动无法欺骗人类。我们的评估侧重于深度神经网络。我们还展示了我们的对抗样本在不同网络间的可迁移性。
引用
@article{arxiv.2203.10166,
title = {Concept-based Adversarial Attacks: Tricking Humans and Classifiers Alike},
author = {Johannes Schneider and Giovanni Apruzzese},
journal= {arXiv preprint arXiv:2203.10166},
year = {2022}
}
备注
Accepted at IEEE Symposium on Security and Privacy (S&P) Workshop on Deep Learning and Security, 2022