利用 Frank-Wolfe 方法生成结构化对抗攻击
机器学习
2021-02-16 v1 人工智能
计算机视觉与模式识别
摘要
白盒对抗扰动最常通过迭代优化算法生成,其通常在原始图像的 邻域(即所谓的失真集)上最小化对抗损失。以不同范数约束对抗搜索会产生结构迥异的对抗样本。本文中,我们探索了若干具有结构增强算法的失真集。这些对抗样本的新结构可能对可证明与经验鲁棒机制构成挑战。由于对抗鲁棒性仍是一个经验性领域,防御机制同样应针对结构不同的攻击进行合理评估。此外,这些结构化对抗扰动相较于其 对应项可能允许更大的失真幅度,同时保持不可感知或作为图像的自然失真可感知。我们将在本文中证明,所提结构化对抗样本可显著降低对抗训练分类器的分类准确率,同时呈现较低的 失真率。例如,在 ImageNet 数据集上,结构化攻击仅用 PGD 等白盒攻击所产生 失真的 50% 便将对抗模型的准确率降至接近零。作为副产品,我们对结构化对抗样本的发现可用于模型的对抗正则化,以使模型更鲁棒或提升其在结构不同数据集上的泛化性能。
引用
@article{arxiv.2102.07360,
title = {Generating Structured Adversarial Attacks Using Frank-Wolfe Method},
author = {Ehsan Kazemi and Thomas Kerdreux and Liquang Wang},
journal= {arXiv preprint arXiv:2102.07360},
year = {2021}
}
备注
arXiv admin note: substantial text overlap with arXiv:2007.01855