在深度学习系统中利用机器遗忘实施后门攻击
密码学与安全
2023-12-14 v2 机器学习
摘要
近年来,由于深度学习研究与应用的快速发展,人工智能的安全问题日益突出。后门攻击是一种针对深度学习模型漏洞的攻击,其中隐藏后门由攻击者嵌入的触发器激活,从而输出可能与给定输入预期输出不一致的恶意预测。本工作中,我们提出一种基于机器遗忘的新型黑盒后门攻击。攻击者首先用精心设计的样本(包括投毒与缓解数据)扩充训练集,以训练一个“良性”模型。随后,攻击者针对缓解样本发布遗忘请求,以消除相关数据对模型的影响,逐步激活隐藏后门。由于后门是在迭代遗忘过程中植入的,它显著增加了现有后门检测或缓解防御方法的计算开销。为应对这一新安全威胁,我们提出两种检测或缓解此类恶意遗忘请求的方法。我们在精确遗忘与近似遗忘(即 SISA)设置下进行了实验。实验结果表明:1)我们的攻击方法能成功将后门植入模型,且分片增加了攻击难度;2)我们的检测算法能有效识别缓解样本,而分片降低了检测算法的有效性。
引用
@article{arxiv.2310.10659,
title = {Exploiting Machine Unlearning for Backdoor Attacks in Deep Learning System},
author = {Peixin Zhang and Jun Sun and Mingtian Tan and Xinyu Wang},
journal= {arXiv preprint arXiv:2310.10659},
year = {2023}
}