中文

多模态大语言模型的视觉幻觉

计算机视觉与模式识别 2024-06-18 v2 人工智能 机器学习

摘要

视觉幻觉(VH)是指多模态大语言模型(MLLM)在视觉问答中对图像想象出不正确的细节。现有研究仅在现有图像数据集中寻找 VH 实例,由于此类 VH 实例的多样性有限,导致对 MLLM 在 VH 下的性能理解存在偏差。在这项工作中,我们提出了一种名为 VHTest 的工具,用于生成多样化的 VH 实例。具体而言,VHTest 在现有图像数据集(例如 COCO)中寻找初始 VH 实例,为每种 VH 模式生成文本描述,并使用文本到图像生成模型(例如 DALL-E-3)根据文本描述生成 VH 图像。我们使用 VHTest 收集了一个包含 8 种 VH 模式下 1,200 个 VH 实例的基准数据集。我们发现,现有的 MLLM(如 GPT-4V、LLaVA-1.5 和 MiniGPT-v2)在我们的基准中对很大一部分实例产生了幻觉。此外,我们发现使用我们的基准数据集对 MLLM 进行微调,可以降低其产生幻觉的可能性,同时不牺牲其在其他基准上的性能。我们的基准已公开可用:https://github.com/wenhuang2000/VHTest。

关键词

引用

@article{arxiv.2402.14683,
  title  = {Visual Hallucinations of Multi-modal Large Language Models},
  author = {Wen Huang and Hongbin Liu and Minxin Guo and Neil Zhenqiang Gong},
  journal= {arXiv preprint arXiv:2402.14683},
  year   = {2024}
}

备注

To appear in ACL Findings, 2024