PiCo:通过图象代码语境化劫持多模态大语言模型
密码学与安全
2025-10-10 v4 人工智能
摘要
多模态大语言模型(MLLMs)将视觉等其他模态集成到大语言模型(LLMs)中,显著提升了 AI 能力,但也引入了新的安全漏洞。通过利用视觉模态的漏洞以及代码训练数据的长尾分布特征,我们提出了一种新的劫持框架 PiCo,用于逐层级地绕过先进 MLLM 的多层防御机制。PiCo 采用逐层级的劫持策略,利用 token 级排版攻击规避输入过滤,并将有害意图嵌入编程上下文指令以规避运行时监控。为全面评估攻击影响,进一步提出了新的评估指标,用于评估模型输出事后 toxicity 和 helpfulness。通过将有害意图嵌入代码风格的视觉指令,PiCo 在 Gemini-Pro Vision 上的平均攻击成功率(ASR)为84.13%,在 GPT-4 上的 ASR 为52.66%,超越了之前的方法。实验结果凸显了当前防御的关键缺口,凸显了为更健全地保护先进 MLLM 所需的更强策略。
引用
@article{arxiv.2504.01444,
title = {PiCo: Jailbreaking Multimodal Large Language Models via Pictorial Code Contextualization},
author = {Aofan Liu and Lulu Tang and Ting Pan and Yuguo Yin and Bin Wang and Ao Yang},
journal= {arXiv preprint arXiv:2504.01444},
year = {2025}
}
备注
Accepted to IEEE International Conference on Multimedia and Expo (ICME) 2025