中文

本能偏见:虚假图像导致多模态大语言模型产生幻觉

计算机视觉与模式识别 2024-10-04 v2 计算与语言 机器学习

摘要

大型语言模型(LLM)最近取得了显著进展,多模态大型语言模型(MLLM)的出现赋予了LLM视觉能力,在各种多模态任务中表现出色。然而,这些强大的MLLM(如GPT-4V)在面对某些图像和文本输入时仍然会严重失败。在本文中,我们识别了一类典型的使MLLM困惑的输入,这些输入包含高度相关但与答案不一致的图像,导致MLLM遭受视觉幻觉。为了量化这种影响,我们提出了CorrelationQA,这是第一个评估在虚假图像下视觉幻觉水平的基准。该基准包含13个类别的7,308个文本-图像对。基于提出的CorrelationQA,我们对9个主流MLLM进行了彻底分析,表明它们普遍不同程度地受到这种本能偏见的影响。我们希望我们策划的基准和评估结果有助于更好地评估MLLM在存在误导性图像时的鲁棒性。代码和数据集可在https://github.com/MasaiahHan/CorrelationQA获取。

关键词

引用

@article{arxiv.2402.03757,
  title  = {The Instinctive Bias: Spurious Images lead to Illusion in MLLMs},
  author = {Tianyang Han and Qing Lian and Rui Pan and Renjie Pi and Jipeng Zhang and Shizhe Diao and Yong Lin and Tong Zhang},
  journal= {arXiv preprint arXiv:2402.03757},
  year   = {2024}
}