中文

基于情境感知对象相似性评估大型视觉语言模型中的幻觉现象

计算机视觉与模式识别 2025-01-28 v1 人工智能 机器学习

摘要

尽管大型视觉语言模型 (LVLMs) 在多模态任务上表现卓越,但仍会因幻觉现象而受到影响。其中一种重要类型为对象幻觉,即模型生成的描述中包含与输入图像不一致的对象。现有方法通常通过检测和衡量生成描述中幻觉对象的比例来量化对象幻觉;此外,近期研究还通过针对基于对象统计信息(如最常见的前 k 个对象和前 k 个共现对象)生成的二进制问题来直接查询 LVLMs,以衡量对象幻觉。在本文中,我们提出情境感知对象相似性 (CAOS),一种基于对象统计信息以及生成描述的全新方法,用于评估 LVLMs 中的对象幻觉。CAOS 独特地将对象统计信息与描述中对象之间的语义关系相结合。此外,现有方法通常仅检测和衡量属于预定 in-domain 对象集合(通常为训练数据集所有真实对象的集合)的幻觉对象,忽略不属于该集合的生成对象,导致评估不足。为此,我们进一步采用基于语言模型的对象识别来检测可能的 out-of-domain 幻觉对象,并利用 LVLMs 组合体验证此类对象在查询图像中的存在情况。CAOS 还检查对象生成的序列动态,揭示对象出现顺序如何影响幻觉现象,并运用词嵌入模型分析幻觉背后的语义原因。CAOS 旨在通过提供系统化框架来识别和解释 LVLMs 的对象幻觉倾向,从而对其进行细致的理解。

关键词

引用

@article{arxiv.2501.15046,
  title  = {Evaluating Hallucination in Large Vision-Language Models based on Context-Aware Object Similarities},
  author = {Shounak Datta and Dhanasekar Sundararaman},
  journal= {arXiv preprint arXiv:2501.15046},
  year   = {2025}
}