中文

面向对抗图像净化的鲁棒语义表示自适应聚类

计算机视觉与模式识别 2021-04-08 v2 人工智能

摘要

深度学习模型极易受到可能导致灾难性后果的对抗性操纵。对此类扰动最有效的防御方法之一是对抗训练,但代价是泛化到未知攻击的能力以及跨模型的迁移性下降。本文提出一种鲁棒对抗攻击防御方法,其模型无关且可泛化至未知攻击者。最初,我们使用基线模型提取每类的潜在表示,并自适应聚类具有语义相似性的潜在表示。我们获得聚类潜在表示的分布,并从其来源图像中学习语义重建字典(SRD)。我们对抗训练一个新模型,约束潜在空间表示以最小化对抗潜在表示与真实聚类分布之间的距离。为净化图像,我们将输入分解为低频与高频分量。高频分量基于干净数据集中最恰当的SRD进行重建。为评估最恰当的SRD,我们依赖鲁棒潜在表示与语义聚类分布之间的距离。输出为无扰动的净化图像。在CIFAR-10和ImageNet-10上使用我们提出的方法进行图像净化,相比SOTA结果准确率提升了超过10%。

关键词

引用

@article{arxiv.2104.02155,
  title  = {Adaptive Clustering of Robust Semantic Representations for Adversarial Image Purification},
  author = {Samuel Henrique Silva and Arun Das and Ian Scarff and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2104.02155},
  year   = {2021}
}

备注

11 pages, 5 figures, 4 tables