通过注入主动防御后门来缓解后门攻击
密码学与安全
2024-10-16 v2 计算机视觉与模式识别
摘要
数据投毒后门攻击是机器学习模型面临的严重安全威胁,攻击者可以操纵训练数据集向模型中注入后门。本文聚焦于训练中的后门防御,旨在即使数据集可能被投毒的情况下也能训练出干净的模型。与大多数现有方法主要检测并移除/遗忘可疑样本以缓解恶意后门攻击不同,我们提出了一种名为PDB(主动防御后门)的新型防御方法。具体来说,PDB利用防御者的主场优势,在训练期间主动向模型中注入一个防御性后门。利用对训练过程的控制,防御性后门被设计为能有效抑制恶意后门,同时对攻击者保持秘密。此外,我们引入了一个可逆映射来确定防御目标标签。在推理阶段,PDB在输入中嵌入一个防御触发器并反转模型的预测,从而抑制恶意后门并确保模型在原始任务上的效用。跨多种数据集和模型的实验结果表明,我们的方法在防御各种后门攻击方面达到了最先进的防御性能。代码可在 https://github.com/shawkui/Proactive_Defensive_Backdoor 获取。
引用
@article{arxiv.2405.16112,
title = {Mitigating Backdoor Attack by Injecting Proactive Defensive Backdoor},
author = {Shaokui Wei and Hongyuan Zha and Baoyuan Wu},
journal= {arXiv preprint arXiv:2405.16112},
year = {2024}
}
备注
Accepted by NeurIPS 2024. 32 pages, 7 figures, 28 tables