中文

GHOST:用于多模态 LLM 的幻觉诱导图像生成

计算机视觉与模式识别 2026-02-03 v3 人工智能 机器学习

摘要

多模态大语言模型(MLLMs)的对象幻觉是一种持续存在的失效模式,导致模型感知到图像中不存在的物体。当前研究使用具有固定视觉情景的静态基准测试来评估这种弱点,这阻碍了发现模型特定或意外的幻觉漏洞的可能性。我们提出GHOST(Generating Hallucinations via Optimizing Stealth Tokens),一种旨在通过主动生成诱导幻觉的图像来压力测试 MLLM 的方法。GHOST 完全自动化,无需人工监督或先验知识。它通过在图像嵌入空间中优化来误导模型,同时保持目标物体缺失,然后引导扩散模型基于该嵌入生成自然图像。生成的图像在视觉上自然且接近原始输入,却引入细微的误导性线索,导致模型幻觉。我们在多种模型(包括如 GLM-4.1V-Thinking 之类的推理模型)上评估了该方法,在幻觉成功率上超过28%,而现有数据驱动发现方法约为1%。我们通过定量指标和人类评估确认,所生成的图像在质量和无物体方面均表现出色。此外,GHOST 未发现可迁移的漏洞:针对 Qwen2.5-VL 优化的图像在 GPT-4o 上以 66.5% 的幻觉成功率诱导幻觉。最后,我们表明在我们的图像上进行微调可缓解幻觉,使 GHOST 成为诊断和纠正工具,帮助构建更可靠的多模态系统。

关键词

引用

@article{arxiv.2509.25178,
  title  = {GHOST: Hallucination-Inducing Image Generation for Multimodal LLMs},
  author = {Aryan Yazdan Parast and Parsa Hosseini and Hesam Asadollahzadeh and Arshia Soltani Moakhar and Basim Azam and Soheil Feizi and Naveed Akhtar},
  journal= {arXiv preprint arXiv:2509.25178},
  year   = {2026}
}