中文

利用 Frank-Wolfe 方法生成结构化对抗攻击

机器学习 2021-02-16 v1 人工智能 计算机视觉与模式识别

摘要

白盒对抗扰动最常通过迭代优化算法生成,其通常在原始图像的 p\ell_p 邻域(即所谓的失真集)上最小化对抗损失。以不同范数约束对抗搜索会产生结构迥异的对抗样本。本文中,我们探索了若干具有结构增强算法的失真集。这些对抗样本的新结构可能对可证明与经验鲁棒机制构成挑战。由于对抗鲁棒性仍是一个经验性领域,防御机制同样应针对结构不同的攻击进行合理评估。此外,这些结构化对抗扰动相较于其 p\ell_p 对应项可能允许更大的失真幅度,同时保持不可感知或作为图像的自然失真可感知。我们将在本文中证明,所提结构化对抗样本可显著降低对抗训练分类器的分类准确率,同时呈现较低的 2\ell_2 失真率。例如,在 ImageNet 数据集上,结构化攻击仅用 PGD 等白盒攻击所产生 2\ell_2 失真的 50% 便将对抗模型的准确率降至接近零。作为副产品,我们对结构化对抗样本的发现可用于模型的对抗正则化,以使模型更鲁棒或提升其在结构不同数据集上的泛化性能。

关键词

引用

@article{arxiv.2102.07360,
  title  = {Generating Structured Adversarial Attacks Using Frank-Wolfe Method},
  author = {Ehsan Kazemi and Thomas Kerdreux and Liquang Wang},
  journal= {arXiv preprint arXiv:2102.07360},
  year   = {2021}
}

备注

arXiv admin note: substantial text overlap with arXiv:2007.01855