H-POPE:基于分层抽样评估大型视觉语言模型中的幻觉
计算机视觉与模式识别
2026-05-12 v2
摘要
通过利用文本和图像,大型视觉语言模型 (LVLMs) 在 various 多模态任务中取得了显著进展。 然而,这些模型常常因幻觉问题而表现不稳定,例如在视觉输入与文本输出之间 exhibit 不一致性。 为了解决这一问题,我们提出 H-POPE,一个 coarse-to-fine-grained 的基准,用于系统性地评估对象存在性和属性方面的幻觉。 我们展示的评估结果表明,模型在对象存在性方面容易产生幻觉,甚至在细粒度属性方面更为如此。 我们进一步研究了这些模型是否依赖于视觉输入来构建输出文本。
引用
@article{arxiv.2411.04077,
title = {H-POPE: Hierarchical Polling-based Probing Evaluation of Hallucinations in Large Vision-Language Models},
author = {Nhi Pham and Michael Schott},
journal= {arXiv preprint arXiv:2411.04077},
year = {2026}
}
备注
Poster at https://sites.google.com/berkeley.edu/bb-stat/home