BruSLeAttack:一种查询高效的基于分数的黑盒稀疏对抗攻击
机器学习
2024-06-04 v2 密码学与安全
摘要
我们研究了仅通过观察模型查询的基于分数的回复来生成稀疏对抗样本这一独特且较少被理解的问题。稀疏攻击旨在发现最少数量的(即 有界的)对模型输入的扰动,以构造对抗样本并误导模型决策。但是,与针对黑盒模型的基于查询的密集攻击相比,即使在基于分数的设置下模型向查询提供置信度分数信息时,构造稀疏对抗扰动也并非易事。因为此类攻击会导致 i) 一个 NP-hard 问题;以及 ii) 一个不可微的搜索空间。我们针对该问题开发了 BruSLeAttack——一种新的、更快的(查询效率更高的)贝叶斯算法。我们进行了广泛的攻击评估,包括以 Google Cloud Vision 为例的机器学习即服务(MLaaS)产品的攻击演示,以及对抗训练机制和最近针对黑盒攻击的防御措施的鲁棒性测试。所提出的攻击在不同模型架构上扩展,在 ImageNet 等标准计算机视觉任务上实现了 SOTA 的攻击成功率和查询效率。我们的工件和 DIY 攻击样本可在 GitHub 上获取。重要的是,我们的工作促进了对模型漏洞的更快评估,并提高了我们对已部署系统的安全性、安全防范和可靠性的警惕。
引用
@article{arxiv.2404.05311,
title = {BruSLeAttack: A Query-Efficient Score-Based Black-Box Sparse Adversarial Attack},
author = {Viet Quoc Vo and Ehsan Abbasnejad and Damith C. Ranasinghe},
journal= {arXiv preprint arXiv:2404.05311},
year = {2024}
}
备注
Published as a conference paper at the International Conference on Learning Representations (ICLR 2024). Code is available at https://brusliattack.github.io/