通过分析训练数据对神经网络实施劫持攻击
密码学与安全
2024-01-22 v2
摘要
后门和对抗样本是深度神经网络 (DNNs) 目前面临的两大主要威胁。这两种攻击都试图通过向输入引入(微小)扰动来劫持模型行为,使其产生非预期输出。后门攻击尽管成功率很高,但通常需要很强的假设,这在现实中并不总是容易实现。对抗样本攻击对攻击者的假设相对较弱,但通常需要很高的计算资源,且在现实世界中攻击主流黑盒模型时并不总能产生令人满意的成功率。这些局限性引出了以下研究问题:能否以更简单的方式、更高的攻击成功率和更合理的假设来实现模型劫持?在本文中,我们提出了 CleanSheet,一种新的模型劫持攻击,它获得了后门攻击的高性能,而无需攻击者篡改模型训练过程。CleanSheet 利用了源于训练数据的 DNNs 漏洞。具体而言,我们的核心思想是将目标模型的部分干净训练数据视为“中毒数据”,并捕获这些数据中对模型更敏感的特征(通常称为鲁棒特征)以构建“触发器”。这些触发器可以添加到任何输入样本中以误导目标模型,类似于后门攻击。我们通过在 5 个数据集、79 个正常训练模型、68 个剪枝模型和 39 个防御模型上的大量实验验证了 CleanSheet 的有效性。结果表明,CleanSheet 表现出与 state-of-the-art 后门攻击相当的性能,在 CIFAR-100 和 GTSRB 上分别实现了 97.5% 和 92.4% 的平均攻击成功率 (ASR)。此外,当面对各种主流后门防御时,CleanSheet 始终保持较高的 ASR。
引用
@article{arxiv.2401.09740,
title = {Hijacking Attacks against Neural Networks by Analyzing Training Data},
author = {Yunjie Ge and Qian Wang and Huayang Huang and Qi Li and Cong Wang and Chao Shen and Lingchen Zhao and Peipei Jiang and Zheng Fang and Shenyi Zhang},
journal= {arXiv preprint arXiv:2401.09740},
year = {2024}
}
备注
Full version with major polishing, compared to the Usenix Security 2024 edition