DifAttack:基于解耦特征空间的查询高效黑盒攻击
计算机视觉与模式识别
2023-12-14 v3 密码学与安全
机器学习
摘要
本工作研究具有高攻击成功率(ASR)和良好泛化能力的基于分数的高效黑盒对抗攻击。我们设计了一种基于解耦特征空间的新攻击方法,称为 DifAttack,它与现有在整体特征空间上操作的攻击方法显著不同。具体而言,DifAttack 首先将图像的潜在特征解耦为对抗特征和视觉特征,其中前者主导图像的对抗能力,而后者在很大程度上决定其视觉外观。我们通过使用干净图像对及其由可用替代模型经白盒攻击方法生成的对抗样本(AEs)来训练用于解耦的自编码器。最终,DifAttack 根据受害模型的查询反馈迭代优化对抗特征,直到生成成功的 AE,同时保持视觉特征不变。此外,由于在为黑盒模型优化 AE 时避免使用替代模型的梯度信息,我们提出的 DifAttack 在开集场景下天然具备更好的攻击能力,其中受害模型的训练数据集未知。大量实验结果表明,我们的方法在 ASR 和查询效率上同时取得显著提升,尤其在目标攻击和开集场景中。代码见 https://github.com/csjunjun/DifAttack.git。
引用
@article{arxiv.2309.14585,
title = {DifAttack: Query-Efficient Black-Box Attack via Disentangled Feature Space},
author = {Liu Jun and Zhou Jiantao and Zeng Jiandian and Jinyu Tian},
journal= {arXiv preprint arXiv:2309.14585},
year = {2023}
}
备注
Accepted in AAAI'24