中文

什么样的“好”干扰项适用于大型视觉语言模型的对象幻觉评估?

计算机视觉与模式识别 2025-08-12 v1 机器学习

摘要

大型视觉语言模型(LVLMs)在大型语言模型(LLMs)的推动下,已在多个领域取得显著成绩。尽管LVLMs取得了巨大进步,但仍存在对象幻觉问题,即生成与图像内容不一致的对象。最常用的基于抽样的 object probing 评估(POPE)基准通过根据类别层次统计信息(例如类别频率和共现情况)抽样负面类别来评估此问题。然而,随着LVLMs的不断进步,POPE基准在评估对象幻觉方面已显现出有效性下降,因为其采用单调的抽样策略,忽略了图像特定信息,并将干扰项限制在负面对象类别中。本文引入了基于幻觉搜索的对象探针评估(HOPE)基准,旨在生成最具误导性的干扰项(即不存在的对象或不正确的图像描述),以触发LVLMs中的幻觉,从而更严格地评估其对幻觉的免疫性。为探索图像特定信息,内容感知的幻觉搜索利用对比语言-图像预训练(CLIP)来近似LVLMs的预测行为,通过选择预测概率最高的负面对象作为干扰项。为扩展幻觉评估的范围,描述符驱动的幻觉搜索通过将真实对象与错误描述配对来构建高度误导性的干扰项。实验结果表明,HOPE在各种最先进的LVLMs中,至少导致精度下降9%,最高可达23%,显著优于POPE在暴露幻觉漏洞方面。代码已公开:https://github.com/xiemk/HOPE。

关键词

引用

@article{arxiv.2508.06530,
  title  = {What Makes "Good" Distractors for Object Hallucination Evaluation in Large Vision-Language Models?},
  author = {Ming-Kun Xie and Jia-Hao Xiao and Gang Niu and Lei Feng and Zhiqiang Kou and Min-Ling Zhang and Masashi Sugiyama},
  journal= {arXiv preprint arXiv:2508.06530},
  year   = {2025}
}