中文

OGAN:以经受训练对抗攻击瓦解 Deepfakes

计算机视觉与模式识别 2020-11-26 v2 密码学与安全 机器学习 机器学习

摘要

自编码器和生成模型的最新进展催生了有效的视频伪造方法,用于生成所谓的“deepfakes”(深度伪造)。缓解研究大多聚焦于事后 deepfake 检测而非预防。我们引入一类新型对抗攻击——抗训练攻击(training-resistant attacks)——来补充这些工作,无论其对抗图像是否已被纳入所述自编码器的训练集,都能破坏换脸自编码器。我们提出振荡 GAN(OGAN)攻击,一种被优化为抗训练的的新型攻击,其对换脸自编码器的输出引入时空失真。为实现 OGAN,我们构建了一个双层优化问题,其中我们训练一个生成器与一个换脸模型实例相互对抗。具体而言,我们将每张输入图像与一个目标失真配对,并将其送入生成器以产生对抗图像。当换脸自编码器应用于该图像时,此图像将呈现该失真。我们通过使用交替优化的迭代过程同时训练生成器和换脸模型来求解该优化问题。接下来,我们分析了先前发表的失真攻击(Distorting Attack)并证明其具有抗训练性,尽管其性能不及我们所提出的 OGAN。最后,我们使用 FaceSwap 的流行实现验证了两种攻击,并表明它们可跨不同目标模型和目标任务迁移,包括未在其上训练过的面部。更广泛地说,这些结果证明了抗训练对抗攻击的存在,其潜在可应用于广泛领域。

关键词

引用

@article{arxiv.2006.12247,
  title  = {OGAN: Disrupting Deepfakes with an Adversarial Attack that Survives Training},
  author = {Eran Segalis and Eran Galili},
  journal= {arXiv preprint arXiv:2006.12247},
  year   = {2020}
}

备注

10 pages