抵御同步数据投毒攻击
机器学习
2024-08-26 v1
摘要
当前的后门防御方法一次只针对单一攻击进行评估。这是不现实的,因为强大的机器学习系统是在从互联网抓取的大型数据集上训练的,这些数据集可能被一个或多个攻击者多次攻击。我们证明,同时执行的数据投毒攻击可以有效地在单个模型中植入多个后门,而不会显著降低干净准确率。此外,我们表明现有的后门防御方法无法有效阻止这种设置下的攻击。最后,我们利用对后门攻击本质的洞察,开发了一种新的防御方法 BaDLoss,它在多攻击设置下是有效的。在最小化干净准确率下降的情况下,BaDLoss 在多攻击设置下对 CIFAR-10 的平均攻击成功率为 7.98%,对 GTSRB 的平均攻击成功率为 10.29%,而其他防御方法的平均攻击成功率分别为 64.48% 和 84.28%。
引用
@article{arxiv.2408.13221,
title = {Protecting against simultaneous data poisoning attacks},
author = {Neel Alex and Shoaib Ahmed Siddiqui and Amartya Sanyal and David Krueger},
journal= {arXiv preprint arXiv:2408.13221},
year = {2024}
}