以攻代守:后处理缓解黑盒基于分数的查询攻击
机器学习
2022-12-19 v3 密码学与安全
摘要
基于分数的查询攻击(SQA)仅利用模型的输出分数,在数十次查询内构造对抗扰动,对深度神经网络构成实际威胁。然而,我们注意到,如果输出损失的趋势被轻微扰动,SQA 很容易被误导从而大幅降低有效性。遵循这一思路,我们提出了一种新颖的防御方法,即对抗攻击攻击者(AAA),通过轻微修改输出 logits 将 SQA 误导至错误的攻击方向。如此一来:(1)无论模型的最坏情况鲁棒性如何,SQA 均被阻止;(2)原始模型预测几乎不变,即干净准确率无下降;(3)置信度分数的校准可同时得到改善。我们提供了大量实验来验证上述优势。例如,在 CIFAR-10 上设置 时,我们提出的 AAA 帮助 WideResNet-28 在 Square 攻击(2500 次查询)下获得 80.59% 的准确率,而此前最佳防御(即对抗训练)仅达到 67.44%。由于 AAA 攻击 SQA 的通用贪婪策略,在 6 种 SQA 下对 8 个 CIFAR-10/ImageNet 模型使用不同攻击目标、边界、范数、损失和策略时,AAA 相对于 8 种防御的优势均可被一致观察到。此外,AAA 在不损害准确率的同时实现了更好的校准。我们的代码可在 https://github.com/Sizhe-Chen/AAA 获取。
引用
@article{arxiv.2205.12134,
title = {Adversarial Attack on Attackers: Post-Process to Mitigate Black-Box Score-Based Query Attacks},
author = {Sizhe Chen and Zhehao Huang and Qinghua Tao and Yingwen Wu and Cihang Xie and Xiaolin Huang},
journal= {arXiv preprint arXiv:2205.12134},
year = {2022}
}
备注
accepted by NeurIPS 2022