中文

从注意力汇聚中看多模态大语言模型的幻觉攻击

机器学习 2025-01-28 v1 密码学与安全 计算机视觉与模式识别

摘要

将视觉理解融入语言生成,多模态大语言模型(MLLMs)正在 revolutionize 视觉语言应用。然而,这些模型常常因幻觉问题而受到困扰,即生成不符合视觉内容的错误对象、属性和关系。在本文中,我们深入分析 MLLMs 的内部注意力机制,揭示了幻觉的内在原因,暴露了指令调优过程中固有的漏洞。我们提出一种新型幻觉攻击,利用注意力汇聚(attention sink)行为,以最小的图像-文本相关性触发幻觉内容,对关键下游应用构成重大威胁。与依赖固定模式的先前对抗方法不同,我们的方法生成动态、有效且高度可迁移的视觉对抗输入,而不牺牲模型响应质量。在 6 个主流 MLLMs 上进行全面实验,表明该攻击在克服黑箱 MLLMs 的广泛防御措施时效果显著,同时对最新商业 API(如 GPT-4o 和 Gemini 1.5)也取得良好结果。我们的代码已公开于 https://huggingface.co/RachelHGF/Mirage-in-the-Eyes。

关键词

引用

@article{arxiv.2501.15269,
  title  = {Mirage in the Eyes: Hallucination Attack on Multi-modal Large Language Models with Only Attention Sink},
  author = {Yining Wang and Mi Zhang and Junjie Sun and Chenyue Wang and Min Yang and Hui Xue and Jialing Tao and Ranjie Duan and Jiexi Liu},
  journal= {arXiv preprint arXiv:2501.15269},
  year   = {2025}
}

备注

USENIX Security 2025