基于机器遗忘的后门防御
密码学与安全
2022-01-25 v1 机器学习
摘要
后门注入攻击是神经网络安全面临的新兴威胁,然而目前针对该攻击的有效防御方法仍然有限。本文提出 BAERASE,一种通过机器遗忘擦除注入到受害模型中的后门的新方法。具体而言,BAERASE 主要通过两个关键步骤实现后门防御。首先,进行触发模式恢复以提取受害模型感染的触发模式。此处,触发模式恢复问题等价于从受害模型中提取未知噪声分布的问题,可通过基于熵最大化的生成模型轻松解决。随后,BAERASE 利用这些恢复的触发模式逆转后门注入过程,并通过新设计的基于梯度上升的机器遗忘方法诱导受害模型擦除被污染的内存。与以往的机器遗忘方案相比,所提方法摆脱了对训练数据完全访问以进行重训练的依赖,并且在后门擦除上比现有的微调或剪枝方法表现出更高的有效性。此外,实验表明,在四个基准数据集上,BAERASE 可平均将三种最先进后门攻击的攻击成功率降低 99%。
引用
@article{arxiv.2201.09538,
title = {Backdoor Defense with Machine Unlearning},
author = {Yang Liu and Mingyuan Fan and Cen Chen and Ximeng Liu and Zhuo Ma and Li Wang and Jianfeng Ma},
journal= {arXiv preprint arXiv:2201.09538},
year = {2022}
}