中文

EventHallusion:诊断视频 LLM 中的事件幻觉

计算机视觉与模式识别 2025-11-19 v6

摘要

近期,多模态大语言模型(MLLMs)在视频理解领域取得了显著进展。尽管它们展示了卓越的内容推理和指令遵循能力,但与图像领域的对应模型相比,这些 VideoLLM 的幻觉问题较少被探索。为弥补这一空白,我们提出了 EventHallusion,一个专注于评估 VideoLLM 对视频分析核心——事件——产生幻觉的新型基准。从幻觉归因的角度,我们的 EventHallusion 基准旨在评估 VideoLLM 对语言先验和视觉-语言偏差的易感性。另一方面,我们还提出了一种简单而有效的方法,称为时序对比解码(TCD),以解决 VideoLLM 的幻觉问题。所提出的 TCD 方法通过将原始视频与破坏了时序线索的修改版本进行比较,在解码阶段纠正模型对其先验的偏差。通过在提出的 EventHallusion 基准上对八个开源和两个闭源 VideoLLM 进行全面评估,我们观察到开源模型存在严重的幻觉问题,而闭源模型的表现则明显更好。通过进一步为开源 VideoLLM 配备所提出的 TCD 方法,在 EventHallusion 基准的大多数指标上均取得了显著的性能提升。我们的代码和基准数据可在 https://github.com/Stevetich/EventHallusion 获取。

关键词

引用

@article{arxiv.2409.16597,
  title  = {EventHallusion: Diagnosing Event Hallucinations in Video LLMs},
  author = {Jiacheng Zhang and Yang Jiao and Shaoxiang Chen and Na Zhao and Zhiyu Tan and Hao Li and Xingjun Ma and Jingjing Chen},
  journal= {arXiv preprint arXiv:2409.16597},
  year   = {2025}
}