SHALE:面向LVLM细粒度幻觉评估的可扩展基准
计算机视觉与模式识别
2025-08-15 v2
摘要
尽管进展迅速,大型视觉语言模型(LVLMs)仍存在幻觉问题,即生成与输入或既定世界知识不一致的内容,分别对应忠实性幻觉和事实性幻觉。先前研究主要在较粗粒度(如对象级)上评估忠实性幻觉,缺乏细粒度分析。此外,现有基准通常依赖昂贵的人工标注或重用公开数据集,引发了对可扩展性和数据泄露的担忧。为解决这些局限,我们提出了一种自动化数据构建流程,可生成可扩展、可控且多样化的评估数据。我们还设计了一个带有输入扰动的分层幻觉诱导框架,以模拟现实中的噪声场景。整合这些设计,我们构建了SHALE,一个可扩展的幻觉评估基准,旨在通过细粒度幻觉分类方案评估忠实性和事实性幻觉。SHALE包含超过3万个图像-指令对,涵盖12个代表性的视觉感知方面(用于忠实性)和6个知识领域(用于事实性),并同时考虑了干净和噪声场景。对超过20个主流LVLM的广泛实验揭示了显著的事实性幻觉问题以及对语义扰动的高度敏感性。
引用
@article{arxiv.2508.09584,
title = {SHALE: A Scalable Benchmark for Fine-grained Hallucination Evaluation in LVLMs},
author = {Bei Yan and Zhiyuan Chen and Yuecong Min and Jie Zhang and Jiahao Wang and Xiaozhen Wang and Shiguang Shan},
journal= {arXiv preprint arXiv:2508.09584},
year = {2025}
}