面向多模态融合模型的基于梯度的越狱图像
密码学与安全
2024-10-24 v2 人工智能
摘要
将图像输入增强到语言模型中可能通过连续优化实现更有效的越狱攻击,不同于需要离散优化的文本输入。然而,新的多模态融合模型使用非可微函数对所有输入模态进行标记化,这会阻碍直接的攻击。在本工作中,我们引入了“标记器捷径”(tokenizer shortcut)的概念,用以用连续函数近似标记化,从而实现连续优化。我们使用标记器捷径创建了针对多模态融合模型的首个端到端梯度图像攻击。我们对攻击在 Chameleon 模型上进行评估,获得的越狱图像可对 72.5% 的提示获取有害信息。越狱图像在目标函数上优于文本越狱,且优化 50x 更多输入 token 所需的计算预算仅为文本越狱的 3 倍。最后,我们发现表示工程防御措施(如 Circuit Breakers),仅基于文本攻击训练的模型可有效地针对对抗图像输入进行转移。
引用
@article{arxiv.2410.03489,
title = {Gradient-based Jailbreak Images for Multimodal Fusion Models},
author = {Javier Rando and Hannah Korevaar and Erik Brinkman and Ivan Evtimov and Florian Tramèr},
journal= {arXiv preprint arXiv:2410.03489},
year = {2024}
}