中文

DataElixir:通过扩散模型净化中毒数据集以缓解后门攻击

密码学与安全 2023-12-21 v2 人工智能 计算机视觉与模式识别

摘要

数据集净化是一种广泛采用的主动防御策略,用于对抗基于投毒的后门攻击,旨在从训练数据集中过滤并移除中毒样本。然而,现有方法在应对不断演变的触发函数方面效果有限,且常常导致良性准确率的显著下降。本文提出 DataElixir,一种专为净化中毒数据集而设计的新型净化方法。我们利用扩散模型消除触发特征并恢复良性特征,从而将中毒样本转化为良性样本。具体而言,通过前向和反向过程的多轮迭代,我们为原始数据集中的每个样本提取中间图像及其预测标签。然后,我们根据中间图像是否存在标签转变来识别异常样本,通过量化分布差异检测目标标签,综合考虑像素和特征距离选择其净化图像,并通过训练一个良性模型来确定其真实标签。在 9 种流行攻击上进行的实验表明,DataElixir 能有效缓解各种复杂攻击,同时对良性准确率影响极小,性能超越了基线防御方法。

关键词

引用

@article{arxiv.2312.11057,
  title  = {DataElixir: Purifying Poisoned Dataset to Mitigate Backdoor Attacks via Diffusion Models},
  author = {Jiachen Zhou and Peizhuo Lv and Yibing Lan and Guozhu Meng and Kai Chen and Hualong Ma},
  journal= {arXiv preprint arXiv:2312.11057},
  year   = {2023}
}

备注

Accepted by AAAI2024