中文

潜在魔力:语义潜在空间中对抗样本的研究

机器学习 2023-05-23 v1

摘要

自 \cite{goodfellow} 指出深度神经网络(DNN)的脆弱性以来,针对 DNN 的对抗攻击一直是一个关键课题。然而,大多数先前工作在像素空间中遵循 lpl_p 范数约束来构造对抗样本。在本文中,我们直观地解释了为何在潜在空间中构造对抗样本同样高效且重要。我们提出了一种基于最先进 Stable Diffusion Model\cite{SDM} 的预训练变分自编码器,在语义潜在空间中构造对抗样本的框架。我们还表明,在潜在空间中构造的对抗样本同样能达到很高的欺骗率。然而,从潜在空间构造的样本往往难以评估,因为它们不遵循特定的 lpl_p 范数约束,这对现有研究是一大挑战。为高效且准确地评估潜在空间中构造的对抗样本,我们提出了基于 SSIM\cite{SSIM} 损失与欺骗率的\textbf{一种新颖评估指标}。此外,我们解释了为何 FID\cite{FID} 不适合衡量此类对抗样本。据我们所知,这是首个专门设计用于评估对抗攻击质量的评估指标。我们还研究了潜在空间中构造的对抗样本的可迁移性,并表明它们优于在像素空间中构造的对抗样本。

关键词

引用

@article{arxiv.2305.12906,
  title  = {Latent Magic: An Investigation into Adversarial Examples Crafted in the Semantic Latent Space},
  author = {BoYang Zheng},
  journal= {arXiv preprint arXiv:2305.12906},
  year   = {2023}
}