中文

FREAK:面向先进多模态大语言模型的细粒度幻觉评估基准

计算机视觉与模式识别 2026-03-23 v1

摘要

多模态大语言模型(MLLMs)存在幻觉问题。现有幻觉评估基准常受限于任务过于简化导致指标饱和,或多样性不足无法充分评估最新多模态模型的幻觉程度。为此,我们提出 FREAK,一个综合性多模态基准,旨在对 MLLMs 进行细粒度幻觉评估。通过高质量的全景实景图像 featuring fine-grained counter-commonsense edits,FREAK 创新性地评估了 MLLMs 在细节视觉感知方面的幻觉现象。大量实验表明,在细节视觉感知方面,SOTA 模型均存在严重幻觉问题。为深入探究,我们构建了受控子集,以间接评估模型感知目标细节信息的能力。通过系统评估主流链式思考(Chain-of-Thought, CoT)提示技术在此任务中的表现,我们揭示了关于幻觉模式和模型推理过程的关键洞见。

关键词

引用

@article{arxiv.2603.19765,
  title  = {FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs},
  author = {Zhihan Yin and Jianxin Liang and Yueqian Wang and Yifeng Yao and Huishuai Zhang and Dongyan Zhao},
  journal= {arXiv preprint arXiv:2603.19765},
  year   = {2026}
}

备注

34 pages