BURN:基于对抗边界分析的后门取消学习
密码学与安全
2025-07-15 v1
摘要
后门取消学习旨在在保持模型原始功能的同时去除后门相关信息。然而,现有的取消学习方法主要关注恢复触发模式,却未能恢复毒样本的正确语义标签。这一局限性阻碍了其完全消除触发模式与目标标签之间错误关联。为此,我们利用边界对抗攻击技术,提出了两个关键观察:首先,毒样本相对于决策边界的距离显著大于干净样本,表明其需要更大的对抗扰动才能改变其预测。其次,尽管干净样本的对抗预测标签在均匀分布,而毒样本的对抗预测标签倾向于恢复其原始正确标签。此外,在添加对抗扰动后,毒样本的特征接近于对应的干净样本。基于这些洞见,我们提出基于对抗边界分析的后门取消学习(BURN),这是一种新型防御框架,集成了错误关联解耦、渐进数据精炼和模型净化。在第一个阶段,BURN 利用对抗边界分析基于其异常对抗边界距离检测毒样本,然后恢复其正确语义标签以进行微调。在第二个阶段,它采用一种反馈机制,跟踪原始后门模型与逐步净化模型之间的预测差异,指导数据集精炼和模型净化。广泛的评估在多个数据集、多个体系结构和七种多样化后门攻击类型下确认,BURN 有效移除后门威胁,同时保持模型的原始性能。
引用
@article{arxiv.2507.10491,
title = {BURN: Backdoor Unlearning via Adversarial Boundary Analysis},
author = {Yanghao Su and Jie Zhang and Yiming Li and Tianwei Zhang and Qing Guo and Weiming Zhang and Nenghai Yu and Nils Lukas and Wenbo Zhou},
journal= {arXiv preprint arXiv:2507.10491},
year = {2025}
}