面向训练时后门防御的渐进式中毒数据隔离
密码学与安全
2023-12-21 v1 人工智能
机器学习
摘要
深度神经网络(DNN)易受后门攻击,恶意攻击者可通过数据中毒操纵模型的预测。因此,制定一种利用潜在中毒数据集训练干净模型的策略至关重要。先前的训练时防御机制通常采用一次性隔离过程,往往导致次优的隔离结果。在本研究中,我们提出了一种新颖且有效的防御方法,称为渐进式中毒数据隔离(PIPD),该方法通过渐进式隔离中毒数据来提高隔离精度,并降低良性样本被误分类为中毒样本的风险。一旦识别出数据集中的中毒部分,我们引入一种选择性训练过程来训练干净模型。通过实施这些技术,我们确保训练后的模型针对中毒数据的攻击成功率显著降低。在多个基准数据集和 DNN 模型上进行的大量实验表明,针对九种最先进的后门攻击,我们的 PIPD 方法在后门防御方面表现出卓越的性能。例如,我们的 PIPD 在 CIFAR-10 数据集上针对多种攻击实现了 99.95% 的平均真阳性率(TPR)和 0.06% 的平均假阳性率(FPR),显著超越了最先进方法的性能。
引用
@article{arxiv.2312.12724,
title = {Progressive Poisoned Data Isolation for Training-time Backdoor Defense},
author = {Yiming Chen and Haiwei Wu and Jiantao Zhou},
journal= {arXiv preprint arXiv:2312.12724},
year = {2023}
}
备注
Accepted to AAAI2024