DataElixir:通过扩散模型净化中毒数据集以缓解后门攻击
密码学与安全
2023-12-21 v2 人工智能
计算机视觉与模式识别
摘要
数据集净化是一种广泛采用的主动防御策略,用于对抗基于投毒的后门攻击,旨在从训练数据集中过滤并移除中毒样本。然而,现有方法在应对不断演变的触发函数方面效果有限,且常常导致良性准确率的显著下降。本文提出 DataElixir,一种专为净化中毒数据集而设计的新型净化方法。我们利用扩散模型消除触发特征并恢复良性特征,从而将中毒样本转化为良性样本。具体而言,通过前向和反向过程的多轮迭代,我们为原始数据集中的每个样本提取中间图像及其预测标签。然后,我们根据中间图像是否存在标签转变来识别异常样本,通过量化分布差异检测目标标签,综合考虑像素和特征距离选择其净化图像,并通过训练一个良性模型来确定其真实标签。在 9 种流行攻击上进行的实验表明,DataElixir 能有效缓解各种复杂攻击,同时对良性准确率影响极小,性能超越了基线防御方法。
引用
@article{arxiv.2312.11057,
title = {DataElixir: Purifying Poisoned Dataset to Mitigate Backdoor Attacks via Diffusion Models},
author = {Jiachen Zhou and Peizhuo Lv and Yibing Lan and Guozhu Meng and Kai Chen and Hualong Ma},
journal= {arXiv preprint arXiv:2312.11057},
year = {2023}
}
备注
Accepted by AAAI2024