中文

面向训练时后门防御的渐进式中毒数据隔离

密码学与安全 2023-12-21 v1 人工智能 机器学习

摘要

深度神经网络(DNN)易受后门攻击,恶意攻击者可通过数据中毒操纵模型的预测。因此,制定一种利用潜在中毒数据集训练干净模型的策略至关重要。先前的训练时防御机制通常采用一次性隔离过程,往往导致次优的隔离结果。在本研究中,我们提出了一种新颖且有效的防御方法,称为渐进式中毒数据隔离(PIPD),该方法通过渐进式隔离中毒数据来提高隔离精度,并降低良性样本被误分类为中毒样本的风险。一旦识别出数据集中的中毒部分,我们引入一种选择性训练过程来训练干净模型。通过实施这些技术,我们确保训练后的模型针对中毒数据的攻击成功率显著降低。在多个基准数据集和 DNN 模型上进行的大量实验表明,针对九种最先进的后门攻击,我们的 PIPD 方法在后门防御方面表现出卓越的性能。例如,我们的 PIPD 在 CIFAR-10 数据集上针对多种攻击实现了 99.95% 的平均真阳性率(TPR)和 0.06% 的平均假阳性率(FPR),显著超越了最先进方法的性能。

关键词

引用

@article{arxiv.2312.12724,
  title  = {Progressive Poisoned Data Isolation for Training-time Backdoor Defense},
  author = {Yiming Chen and Haiwei Wu and Jiantao Zhou},
  journal= {arXiv preprint arXiv:2312.12724},
  year   = {2023}
}

备注

Accepted to AAAI2024