中文

持续游动:真实攻击者仅需多模型系统的部分知识

机器学习 2024-11-01 v1 人工智能 密码学与安全 计算机视觉与模式识别 多智能体系统

摘要

最近的机器学习方法通常使用多个模型或智能体架构的组合来解决任务。当针对组合系统进行对抗攻击时,训练一个端到端的代理模型或为系统的每个组件训练代理模型在计算或信息上可能不可行。我们引入了一种方法,在仅拥有最终黑盒模型的代理模型,且初始模型施加的变换可能使对抗扰动失效的情况下,对整个多模型系统实施对抗攻击。当前方法通过将第一个模型/变换的多个副本应用于输入,然后通过平均梯度或学习两个阶段的代理模型来重用标准对抗攻击。据我们所知,这是首个专门为此威胁模型设计的攻击,与先前最先进的方法相比,我们的方法攻击成功率显著提高(80% vs 25%),且扰动均方误差(MSE)减小了9.4%。我们的实验聚焦于有监督图像流水线,但我们确信该攻击将推广到其他多模型设置(例如,开源/闭源基础模型的混合)或智能体系统。

关键词

引用

@article{arxiv.2410.23483,
  title  = {Keep on Swimming: Real Attackers Only Need Partial Knowledge of a Multi-Model System},
  author = {Julian Collado and Kevin Stangl},
  journal= {arXiv preprint arXiv:2410.23483},
  year   = {2024}
}

备注

11 pages, 2 figures