中文

BAAAN:针对自编码器与基于 GAN 的机器学习模型的后门攻击

密码学与安全 2020-10-09 v2 人工智能 机器学习

摘要

自编码器与生成对抗网络(GANs)的巨大进展已导致它们被应用于多个关键任务,例如欺诈检测与净化数据生成。这种日益增长的应用促进了针对这些模型的安全与隐私风险的研究。然而,先前工作主要关注成员推断攻击。本工作中,我们探索针对机器学习模型最严重的攻击之一,即后门攻击,针对自编码器与 GANs。后门攻击是一种训练时攻击,其中 adversary 在目标模型中植入仅可由秘密触发器激活的隐藏后门。最先进的后门攻击聚焦于基于分类的任务。我们将后门攻击的适用性扩展到自编码器与基于 GAN 的模型。更具体地,我们提出了首个针对自编码器与 GANs 的后门攻击,其中 adversary 可在后门激活时控制解码或生成的图像内容。我们的结果表明,adversary 可构建后门自编码器,其对所有后门输入返回目标输出,同时在干净输入上表现完全正常。类似地,对于 GANs,我们的实验表明 adversary 可在后门激活时从不同的分布生成数据,而在后门未激活时保持相同效用。

关键词

引用

@article{arxiv.2010.03007,
  title  = {BAAAN: Backdoor Attacks Against Autoencoder and GAN-Based Machine Learning Models},
  author = {Ahmed Salem and Yannick Sautter and Michael Backes and Mathias Humbert and Yang Zhang},
  journal= {arXiv preprint arXiv:2010.03007},
  year   = {2020}
}