ELV-Halluc:长视频理解中语义聚合幻觉的基准测试
计算机视觉与模式识别
2025-09-03 v2 人工智能
摘要
视频多模态大语言模型(Video-MLLMs)在视频理解方面取得了显著进展。然而,它们仍然容易产生与视频输入内容不一致或无关的内容幻觉。以往的视频幻觉基准主要聚焦于短视频,认为幻觉原因包括强语言先验、帧缺失或由视觉编码器引入的视觉语言偏差。虽然这些原因确实解释了大多数短视频幻觉,但仍显得过于简化。有时,模型会生成错误输出,但帧级语义是正确的。我们将这种类型的幻觉称为语义聚合幻觉(Semantic Aggregation Hallucination, SAH),它发生在将帧级语义聚合到事件级语义组的过程中。鉴于SAH在因事件语义复杂度增加而尤为关键的长视频中,必须分离并彻底调查此类幻觉的原因。为此,我们引入ELV-Halluc,第一个专注于长视频幻觉的基准测试,使其能够系统性地调查SAH。我们的实验确认了SAH的存在,并表明其随语义复杂度的增加而增大。此外,我们发现模型在快速变化的语义上更容易产生SAH。我们还讨论了缓解SAH的潜在方法。我们证明位置编码策略有助于缓解SAH,进一步采用DPO策略来增强模型区分事件内及跨事件语义的能力。为支持这一工作,我们构建了8K组对抗性数据对,显著提升了ELV-Halluc和Video-MME上的性能,其中SAH比率降低了27.7%。
关键词
引用
@article{arxiv.2508.21496,
title = {ELV-Halluc: Benchmarking Semantic Aggregation Hallucinations in Long Video Understanding},
author = {Hao Lu and Jiahao Wang and Yaolun Zhang and Ruohui Wang and Xuanyu Zheng and Yepeng Tang and Dahua Lin and Lewei Lu},
journal= {arXiv preprint arXiv:2508.21496},
year = {2025}
}