RAB:可证明的抗后门攻击鲁棒性
机器学习
2023-08-04 v8 机器学习
摘要
近期研究表明,深度神经网络(DNNs)易受对抗攻击,包括规避攻击与后门(投毒)攻击。在防御方面,已有大量工作致力于提升针对规避攻击的经验鲁棒性与可证明鲁棒性;然而,针对后门攻击的可证明鲁棒性仍基本未被探索。本文关注认证机器学习模型针对通用威胁模型尤其是后门攻击的鲁棒性。我们首先通过随机平滑技术提供一个统一框架,并展示它如何被实例化以认证针对规避与后门攻击的鲁棒性。随后我们提出首个鲁棒训练过程RAB,以平滑训练后的模型并认证其抗后门攻击的鲁棒性。我们证明了用RAB训练的机器学习模型的鲁棒性界,并证明该鲁棒性界是紧的。此外,我们从理论上表明,对简单模型如K近邻分类器高效训练鲁棒平滑模型是可能的,并提出了一种精确平滑训练算法,消除了此类模型从噪声分布采样的需要。在经验上,我们在MNIST、CIFAR-10和ImageNette数据集上对不同的机器学习(ML)模型如DNNs、支持向量机和K-NN模型进行了全面实验,并提供了针对后门攻击认证鲁棒性的首个基准。此外,我们在spambase表格数据集上评估K-NN模型,以展示所提精确算法的优势。理论分析与在多样ML模型和数据集上的全面评估均为针对通用训练时攻击的进一步鲁棒学习策略提供了启示。
引用
@article{arxiv.2003.08904,
title = {RAB: Provable Robustness Against Backdoor Attacks},
author = {Maurice Weber and Xiaojun Xu and Bojan Karlaš and Ce Zhang and Bo Li},
journal= {arXiv preprint arXiv:2003.08904},
year = {2023}
}
备注
IEEE Symposium on Security and Privacy 2023