基于贪婪算法的细粒度黑箱对抗攻击——GreedyPixel
计算机视觉与模式识别
2026-01-16 v4 密码学与安全
机器学习
摘要
深度神经网络对对抗样本极其脆弱,这些样本是经过精心设计的、具有微小扰动的输入,可能导致错误分类,这使得对抗攻击成为评估鲁棒性的关键工具。现有黑箱方法通常在精度与灵活性之间存在权衡:像素稀疏攻击(如单像素或少量像素攻击)提供细粒度控制但缺乏适应性,而 patch 或频率-based 攻击提高了效率或可迁移性,但会产生更大且不够精确的扰动。我们提出了 GreedyPixel,这是一种细粒度黑箱攻击方法,通过一组来自代理人-derived 优先级图引导的暴力式、逐像素贪婪优化,经查询反馈加以细化。它直接评估每个坐标,而无需任何梯度信息,确保损失单调减少并收敛到坐标级最优值,同时也能实现接近白盒水平的精度和像素稀疏性以及感知质量。在 CIFAR-10 和 ImageNet 数据集上,spanning 卷积神经网络(CNN)和 Transformer 模型,GreedyPixel 实现了在视觉几乎不可察觉的扰动下的最高成功率,有效地弥合了黑箱实用性与白盒性能之间的差距。实现代码已公开于 https://github.com/azrealwang/greedypixel。
引用
@article{arxiv.2501.14230,
title = {GreedyPixel: Fine-Grained Black-Box Adversarial Attack Via Greedy Algorithm},
author = {Hanrui Wang and Ching-Chun Chang and Chun-Shien Lu and Christopher Leckie and Isao Echizen},
journal= {arXiv preprint arXiv:2501.14230},
year = {2026}
}
备注
IEEE Transactions on Information Forensics and Security