FREAK:面向先进多模态大语言模型的细粒度幻觉评估基准
计算机视觉与模式识别
2026-03-23 v1
摘要
多模态大语言模型(MLLMs)存在幻觉问题。现有幻觉评估基准常受限于任务过于简化导致指标饱和,或多样性不足无法充分评估最新多模态模型的幻觉程度。为此,我们提出 FREAK,一个综合性多模态基准,旨在对 MLLMs 进行细粒度幻觉评估。通过高质量的全景实景图像 featuring fine-grained counter-commonsense edits,FREAK 创新性地评估了 MLLMs 在细节视觉感知方面的幻觉现象。大量实验表明,在细节视觉感知方面,SOTA 模型均存在严重幻觉问题。为深入探究,我们构建了受控子集,以间接评估模型感知目标细节信息的能力。通过系统评估主流链式思考(Chain-of-Thought, CoT)提示技术在此任务中的表现,我们揭示了关于幻觉模式和模型推理过程的关键洞见。
引用
@article{arxiv.2603.19765,
title = {FREAK: A Fine-grained Hallucination Evaluation Benchmark for Advanced MLLMs},
author = {Zhihan Yin and Jianxin Liang and Yueqian Wang and Yifeng Yao and Huishuai Zhang and Dongyan Zhao},
journal= {arXiv preprint arXiv:2603.19765},
year = {2026}
}
备注
34 pages