多模态模型的对抗性攻击
密码学与安全
2024-09-25 v2 信息检索
机器学习
摘要
多模态模型因其强大的能力而受到广泛关注。这些模型能够在跨越多样数据模态的嵌入之间实现对齐,展现出优于单模态方法的下游任务性能。近期研究表明,攻击者可以通过改变图像或音频文件的方式,使其嵌入匹配攻击者选择的目标输入,从而欺骗下游模型。然而,这种方法常常表现不佳,由于不同模态数据之间的内在差异。本文引入一种新颖的方法——CrossFire,以攻击多模态模型。CrossFire 通过将攻击者选择的目标输入转换为与原始图像或音频文件相同模态的格式来开始。随后,我们将攻击形式化为一个优化问题,旨在最小化转换后输入嵌入与被修改后的图像或音频文件嵌入之间的夹角偏差。求解此问题即确定添加到原始媒体上的扰动。我们在六个真实世界基准数据集上进行了大量实验,发现 CrossFire 能显著操控下游任务,超越现有攻击方法。此外,我们评估了六种防御策略以抵御 CrossFire,发现现有防御措施不足以抵御我们的 CrossFire。
引用
@article{arxiv.2409.06793,
title = {Adversarial Attacks to Multi-Modal Models},
author = {Zhihao Dou and Xin Hu and Haibo Yang and Zhuqing Liu and Minghong Fang},
journal= {arXiv preprint arXiv:2409.06793},
year = {2024}
}
备注
To appear in the ACM Workshop on Large AI Systems and Models with Privacy and Safety Analysis 2024 (LAMPS '24)