中文

GPT-4V(ision) 幻觉的整体分析:偏差与干扰挑战

机器学习 2023-11-08 v2 计算与语言 计算机视觉与模式识别

摘要

尽管 GPT-4V(ision) 能够同时令人印象深刻地建模视觉与文本信息,但其幻觉行为尚未得到系统评估。为弥补这一空白,我们引入了一个新的基准,即视觉语言模型中的偏差与干扰挑战(Bingo)。该基准旨在评估并阐明视觉语言模型中两类常见的幻觉:偏差与干扰。此处,偏差指模型倾向于幻觉出某些类型的响应,可能源于其训练数据的不平衡。干扰涉及由于文本提示的措辞方式或输入图像的呈现方式而导致 GPT-4V(ision) 的判断受到干扰的场景。我们发现了一种显著的区域偏差,即相比于来自其他国家或包含其他语言文本的图像,GPT-4V(ision) 更擅长解读西方图像或带有英文文字的图像。此外,GPT-4V(ision) 易受引导性问题的攻击,且在联合解读多张图像时常常感到困惑。诸如自我纠正与思维链推理等流行的缓解方法,在解决这些挑战时并不有效。我们也在 LLaVA 和 Bard 上发现了类似的偏差与干扰漏洞。我们的结果刻画了 GPT-4V(ision) 与最先进视觉语言模型中的幻觉挑战,并凸显了对新解决方案的需求。Bingo 基准可在 https://github.com/gzcch/Bingo 获取。

关键词

引用

@article{arxiv.2311.03287,
  title  = {Holistic Analysis of Hallucination in GPT-4V(ision): Bias and Interference Challenges},
  author = {Chenhang Cui and Yiyang Zhou and Xinyu Yang and Shirley Wu and Linjun Zhang and James Zou and Huaxiu Yao},
  journal= {arXiv preprint arXiv:2311.03287},
  year   = {2023}
}