基于距离驱动解毒的后门缓解
密码学与安全
2025-02-12 v2
摘要
后门攻击通过允许攻击者利用投毒训练数据操纵预测,破坏了机器学习模型的完整性。当存在特定触发器时,此类攻击会导致有针对性的误分类,而在其他条件下模型表现正常。本文考虑后训练后门防御任务,旨在解除预训练模型中的后门。我们首先分析了普通微调的潜在问题,并观察到它往往陷入对干净样本和投毒样本均具有低损失的区域。受此观察启发,我们提出了距离驱动解毒(D3),这是一种将后门防御重新表述为约束优化问题的创新方法。具体而言,D3促使模型远离其初始权重的邻域,从而有效减弱后门的影响。在各种模型架构和数据集上的最先进(SOTA)后门攻击的大量实验表明,D3不仅匹配,而且往往超越现有SOTA后训练防御技术的性能。
引用
@article{arxiv.2411.09585,
title = {Backdoor Mitigation by Distance-Driven Detoxification},
author = {Shaokui Wei and Jiayin Liu and Hongyuan Zha},
journal= {arXiv preprint arXiv:2411.09585},
year = {2025}
}
备注
Preprint version. Fix issues in Figure 1. Thanks for the readers' comments