基于图像的提示注入:通过视觉嵌入对抗性指令劫持多模态大语言模型
计算机视觉与模式识别
2026-03-05 v1 人工智能
密码学与安全
摘要
多模态大语言模型(MLLM)将视觉与文本集成以驱动应用,但这种集成引入了新的漏洞。我们研究了基于图像的提示注入(IPI),这是一种黑盒攻击,通过将对抗性指令嵌入到自然图像中以覆盖模型行为。我们的端到端 IPI 流程集成了基于分段的区域选择、自适应字体缩放和背景感知渲染,以在人类感知中隐藏提示同时保持模型可解释性。使用 COCO 数据集和GPT-4-turbo,我们评估了12种对抗性提示策略和多种嵌入配置。结果表明,IPI 能够可靠地操控模型输出,在隐形约束下,最有效的配置实现了最高达64%的攻击成功率。这些发现将 IPI 定性为黑盒环境中的实用威胁,凸显了针对多模态提示注入需要防御的必要性。
引用
@article{arxiv.2603.03637,
title = {Image-based Prompt Injection: Hijacking Multimodal LLMs through Visually Embedded Adversarial Instructions},
author = {Neha Nagaraja and Lan Zhang and Zhilong Wang and Bo Zhang and Pawan Patil},
journal= {arXiv preprint arXiv:2603.03637},
year = {2026}
}
备注
7 pages, published in 2025 3rd International Conference on Foundation and Large Language Models (FLLM), Vienna, Austria