中文

VideoHallu:评估与缓解合成视频理解中的多模态幻觉

计算机视觉与模式识别 2025-10-28 v4 机器学习

摘要

视觉-语言模型(VLMs)在视频理解方面取得了显著成果,但一个关键问题仍然存在:它们是否真正理解了视觉内容,还是仅仅学习了视觉与语言之间的浅层关联?真正的视觉理解,尤其是对物理和常识的理解,对于与物理世界交互的 AI 系统至关重要。当前的评估大多使用与训练数据相似的现实世界视频,因此高基准分数可能无法反映真正的推理能力。为了解决这个问题,我们提出了使用描绘物理上不可能或逻辑上不一致事件的视频进行阴性对照测试。我们引入了 VideoHallu,这是一个使用 Veo2、Sora 和 Kling 生成的、包含违反物理和常识场景的合成数据集。它包含跨四类违规行为的专家注释问答对。对领先的 VLM(Qwen-2.5-VL、Video-R1、VideoChat-R1)的测试表明,尽管它们在 MVBench 和 MMVU 等基准测试上表现强劲,但它们经常忽略这些违规行为,暴露了视觉推理的差距。在 VideoHallu 上进行强化学习微调可以提高对此类违规行为的识别能力,而不会降低标准基准测试的性能。我们的数据可在 https://github.com/zli12321/VideoHallu.git 获取。

关键词

引用

@article{arxiv.2505.01481,
  title  = {VideoHallu: Evaluating and Mitigating Multi-modal Hallucinations on Synthetic Video Understanding},
  author = {Zongxia Li and Xiyang Wu and Guangyao Shi and Yubin Qin and Hongyang Du and Fuxiao Liu and Tianyi Zhou and Dinesh Manocha and Jordan Lee Boyd-Graber},
  journal= {arXiv preprint arXiv:2505.01481},
  year   = {2025}
}