BAAAN:针对自编码器与基于 GAN 的机器学习模型的后门攻击
密码学与安全
2020-10-09 v2 人工智能
机器学习
摘要
自编码器与生成对抗网络(GANs)的巨大进展已导致它们被应用于多个关键任务,例如欺诈检测与净化数据生成。这种日益增长的应用促进了针对这些模型的安全与隐私风险的研究。然而,先前工作主要关注成员推断攻击。本工作中,我们探索针对机器学习模型最严重的攻击之一,即后门攻击,针对自编码器与 GANs。后门攻击是一种训练时攻击,其中 adversary 在目标模型中植入仅可由秘密触发器激活的隐藏后门。最先进的后门攻击聚焦于基于分类的任务。我们将后门攻击的适用性扩展到自编码器与基于 GAN 的模型。更具体地,我们提出了首个针对自编码器与 GANs 的后门攻击,其中 adversary 可在后门激活时控制解码或生成的图像内容。我们的结果表明,adversary 可构建后门自编码器,其对所有后门输入返回目标输出,同时在干净输入上表现完全正常。类似地,对于 GANs,我们的实验表明 adversary 可在后门激活时从不同的分布生成数据,而在后门未激活时保持相同效用。
引用
@article{arxiv.2010.03007,
title = {BAAAN: Backdoor Attacks Against Autoencoder and GAN-Based Machine Learning Models},
author = {Ahmed Salem and Yannick Sautter and Michael Backes and Mathias Humbert and Yang Zhang},
journal= {arXiv preprint arXiv:2010.03007},
year = {2020}
}