针对黑盒模型对抗攻击的无数据防御
机器学习
2024-03-29 v3 密码学与安全
计算机视觉与模式识别
摘要
一些公司通常仅通过 API 将训练好的深度模型(即架构细节、学习到的权重、训练细节等)作为黑盒向第三方用户暴露,从而保护其免受第三方用户获取。此外,由于专有原因或敏感性考虑,它们甚至可能不提供对训练数据的访问。在这项工作中,我们提出了一种在无数据设置下针对黑盒模型对抗攻击的新颖防御机制。我们通过生成模型构造合成数据,并利用模型窃取技术训练替代网络。为了最小化扰动样本上的对抗污染,我们提出了“小波噪声去除器”(WNR),它对输入图像执行离散小波分解,并仅精心选择由我们的“小波系数选择模块”(WCSM)确定的少数重要系数。为了在通过 WNR 去噪后恢复图像的高频内容,我们进一步训练一个“再生器”网络,其目标是检索系数,使得重建图像在替代模型上产生与原始预测相似的结果。在测试时,WNR 与训练好的再生器网络相结合并置于黑盒网络之前,从而大幅提高对抗准确率。即使在攻击者使用与黑盒架构(Alexnet)相似且采用与防御者相同模型窃取策略的替代架构(Alexnet-half 和 Alexnet)时,我们的方法在 CIFAR-10 上相较于基线在先进 Auto Attack 下的对抗准确率分别提高了 38.98% 和 32.01%。代码可在 https://github.com/vcl-iisc/data-free-black-box-defense 获取。
引用
@article{arxiv.2211.01579,
title = {Data-free Defense of Black Box Models Against Adversarial Attacks},
author = {Gaurav Kumar Nayak and Inder Khatri and Ruchit Rawal and Anirban Chakraborty},
journal= {arXiv preprint arXiv:2211.01579},
year = {2024}
}
备注
CVPR Workshop (Under Review)