中文

请原谅我的图片:通过视觉提示注入防止多模态大语言模型分析图片

计算机视觉与模式识别 2026-04-13 v1 人工智能 密码学与安全 机器学习

摘要

多模态大语言模型(MLLMs)已成为分析互联网规模图片数据的强大工具,带来显著利益,但也引发安全与社会层面的关键担忧。特别是开源权重MLLMs可能被滥用,以大规模提取个人图片中的敏感信息(如身份、位置或其他私人细节)。本文提出ImageProtector——一种用户侧方法,通过嵌入精心设计的近乎不可感知的扰动来保护图片,使其成为对MLLMs的视觉提示注入攻击。当对手使用MLLMs分析受保护图片时,MLLM会被诱导生成拒绝响应(如"对不起,我无法帮助您完成此请求")。我们在六个MLLMs和四个数据集上实证验证了ImageProtector的有效性。此外,我们评估了三个潜在对策:高斯噪声、DiffPure和对抗训练,发现虽能部分缓解ImageProtector的影响,但同时降低模型准确率和/或效率。我们的研究聚焦于开源权重MLLMs和大规模自动化图片分析场景,凸显了基于扰动的隐私保护方法的前景与局限。

关键词

引用

@article{arxiv.2604.09024,
  title  = {Leave My Images Alone: Preventing Multi-Modal Large Language Models from Analyzing Images via Visual Prompt Injection},
  author = {Zedian Shao and Hongbin Liu and Yuepeng Hu and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2604.09024},
  year   = {2026}
}

备注

Appeared in ACL 2026 main conference