中文

VidHal:面向视觉大语言模型时序幻觉的基准测试

计算机视觉与模式识别 2026-04-24 v3

摘要

视觉大语言模型(VLLMs)广为人知容易产生幻觉。现有研究主要局限于图像输入,对视频based幻觉的探索有限。此外,当前的评估方法未能捕捉生成响应中细微的错误,这些错误因视频的丰富时空动力学而加剧。为此,我们提出VidHal,一个专为评估VLLMs视频based幻觉设计的基准测试。VidHal通过在广泛的常见时序方面上引导视频实例构建而成。我们基准测试的关键特征在于精心创建的标题,代表每个视频不同水平的幻觉。为实现细粒度评估,我们提出了一种新颖的标题排序任务,需要VLLMs按幻觉程度对标题进行排序。我们在VidHal上进行了大规模实验,并全面评估了广泛选择的模型。结果揭示了现有VLLMs在幻觉生成方面的显著局限。通过我们的基准测试,我们旨�激发进一步的研究:1)对VLLM能力的整体理解,尤其是关于幻觉的问题,以及2)开发以缓解此问题的高级VLLMs。

关键词

引用

@article{arxiv.2411.16771,
  title  = {VidHal: Benchmarking Temporal Hallucinations in Vision LLMs},
  author = {Wey Yeh Choong and Yangyang Guo and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2411.16771},
  year   = {2026}
}

备注

To appear in TMLR 2026. Code available at https://github.com/Lookuz/VidHal