Agent Smith:单张图像可指数级快速越狱百万多模态 LLM Agent
计算与语言
2024-06-04 v2 密码学与安全
计算机视觉与模式识别
机器学习
多智能体系统
摘要
多模态大型语言模型(MLLM)agent 能够接收指令、捕获图像、从记忆中检索历史,并决定使用哪些工具。尽管如此,红队测试工作表明,对抗性图像/提示词可以越狱 MLLM 并导致不对齐行为。在本工作中,我们报告了多 agent 环境中一个更为严重的安全问题,称为传染性越狱。它仅需对手越狱单个 agent,在对手没有任何进一步干预的情况下,(几乎)所有 agent 都会以指数级速度被感染并表现出有害行为。为了验证传染性越狱的可行性,我们模拟了包含多达一百万个 LLaVA-1.5 agent 的多 agent 环境,并采用随机两两聊天作为多 agent 交互的概念验证实例。我们的结果表明,将一张(传染性)对抗性图像输入到任意随机选择的 agent 的记忆中,足以实现传染性越狱。最后,我们推导出一个简单原则,用于判定防御机制能否可证明地抑制传染性越狱的传播,但如何设计满足该原则的实用防御机制仍是一个有待研究的开放问题。我们的项目页面可在 https://sail-sg.github.io/Agent-Smith/ 获取。
引用
@article{arxiv.2402.08567,
title = {Agent Smith: A Single Image Can Jailbreak One Million Multimodal LLM Agents Exponentially Fast},
author = {Xiangming Gu and Xiaosen Zheng and Tianyu Pang and Chao Du and Qian Liu and Ye Wang and Jing Jiang and Min Lin},
journal= {arXiv preprint arXiv:2402.08567},
year = {2024}
}
备注
ICML 2024