平坦性感知的顺序学习生成具有韧性的后门
机器学习
2024-07-23 v1 人工智能
密码学与安全
摘要
最近,后门攻击已成为机器学习模型安全的 emerging threat。从对手的角度来看,植入的后门应抵抗对抗性算法,但一些最近提出的微调防御方法可以显著有效地移除这些后门。这主要归因于深度神经网络的灾难性遗忘 (Catastrophic Forgetting, CF) 特性。本文通过利用持续学习 (Continual Learning, CL) 技术来抵消后门的 CF。我们首先研究了后门模型与微调模型之间的连通性。我们的分析表明,尤其是更先进的微调防御方法,可以轻易地将中毒模型推出后门区域,使其忘记所有后门。基于此发现,我们通过持续学习的视角重新构建后门训练,提出一种新框架,称为顺序后门学习 (Sequential Backdoor Learning, SBL),用于生成韧性后门。该框架将后门投毒过程分为两个任务:第一个任务学习一个后门模型,而第二个任务基于 CL 原理,将其移动到抵抗微调的后门区域。我们 additionally 提议通过锋利度感知最小化器寻求更平坦的后门区域,从而进一步增强植入后门的耐久性。最后,我们在后门领域的几个基准数据集上通过大量实验演示了该方法的有效性。源码可在 https://github.com/mail-research/SBL-resilient-backdoors 获取。
引用
@article{arxiv.2407.14738,
title = {Flatness-aware Sequential Learning Generates Resilient Backdoors},
author = {Hoang Pham and The-Anh Ta and Anh Tran and Khoa D. Doan},
journal= {arXiv preprint arXiv:2407.14738},
year = {2024}
}
备注
ECCV 2024