注意差距:通过查询更新分析检测正在生成的黑盒对抗攻击
密码学与安全
2025-03-18 v3
摘要
对抗攻击仍然是威胁机器学习(ML)模型完整性的重大威胁。特别是,基于查询的黑盒攻击可以在无法访问受害者模型架构的情况下生成恶意噪声,使其在现实场景中具有实用性。该社区提出了多种对抗攻击的防御措施,但随后被更先进和自适应攻击策略所破解。在本文中,我们提出了一种检测对抗噪声实例是否正在生成的框架。与现有通过监控输入空间检测对抗噪声生成的有状态防御不同,我们的方法在输入更新相似性空间中学习对抗模式。事实上,我们提出观察一种称为Delta相似性(DS)的新度量,我们证明它更高效地捕捉对抗行为。我们针对8种最先进的攻击(包括自适应攻击,其中对抗者了解防御并试图规避检测)评估了我们的方法。我们发现,我们的方法在特异性和灵敏度两方面均显著优于现有防御。
引用
@article{arxiv.2503.02986,
title = {Mind the Gap: Detecting Black-box Adversarial Attacks in the Making through Query Update Analysis},
author = {Jeonghwan Park and Niall McLaughlin and Ihsen Alouani},
journal= {arXiv preprint arXiv:2503.02986},
year = {2025}
}
备注
14 pages