中文

NOAH:面向视频大语言模型的叙事先验驱动的幻觉与遗漏基准

计算机视觉与模式识别 2025-11-11 v1

摘要

视频大语言模型 (Video LLMs) 近期在描述、摘要和问答等任务上取得了显著性能。许多模型和训练方法明确鼓励事件之间的连续性,以增强叙事连贯性。虽然这提高了流畅度,但也引入了一种先验偏置,优先考虑叙事一致性而非严格的视觉证据。我们识别了这种偏置,称为叙事先验 (narrative prior),作为两种错误的关键驱动因素:幻觉,即引入不存在的事件或误解现有事件的情况;遗漏,即因与周围上下文不一致而被抑制的事实事件。为系统评估叙事先验引起的错误,我们引入 NOAH,一个大型基准数据集,通过将来自其他来源的片段插入目标视频中来构建复合视频。通过变化语义相似度和插入位置,我们的基准数据集实现了叙事先验的受控且可扩展的分析。我们设计了一个 captioning 任务以配套指标,并设计了三个 QA 任务——存在性 (Existence)、时间性 (Temporal) 和叙事性 (Narrative),产生超过 6 万个评估样本。大量实验得出三个关键发现:(i) 大多数视频大语言模型都受叙事先验驱动产生幻觉和遗漏;(ii) 这些错误模式在不同架构之间变化,取决于事件相似度和插入位置;(iii) 在帧数较少的采样下,依赖叙事先验会加剧错误,当事件连续性较弱时尤其如此。我们确立 NOAH 作为评估视频大语言模型中叙事先验驱动的幻觉与遗漏的首个标准化基准,为开发更可靠可信的模型提供了基础。我们的基准数据集和代码已在 https://anonymous550520.github.io/ 上提供。

关键词

引用

@article{arxiv.2511.06475,
  title  = {NOAH: Benchmarking Narrative Prior driven Hallucination and Omission in Video Large Language Models},
  author = {Kyuho Lee and Euntae Kim and Jinwoo Choi and Buru Chang},
  journal= {arXiv preprint arXiv:2511.06475},
  year   = {2025}
}

备注

18 pages, 9 figures. Preprint