中文

MESH -- 类似人类理解视频: 衡量大视频模型中的幻觉

计算机视觉与模式识别 2025-09-12 v2 人工智能

摘要

大视频模型 (LVMs) 建立在大语言模型 (LLMs) 的语义能力与视觉模块的基础上,通过整合时间信息来更好地理解动态视频内容。尽管取得了进展,LVMs 仍容易产生幻觉 — — 即生成不准确或无关描述。当前的视频幻觉基准测试严重依赖对视频内容的手动分类,忽略了人类自然解释视频所经历的感知过程。我们引入 MESH,一个系统性评估 LVMs 幻觉的基准测试。MESH 使用包含二元和多选格式的问答框架,包含目标实例和陷阱实例。它遵循自下而上的方法,从基本对象、粗到细的主体特征到主体-动作对,align于人类视频理解。我们展示 MESH 提供了有效且全面的 LVMs 视频中识别幻觉的方法。我们的评估显示,尽管 LVMs 在识别基本对象和特征方面表现出色,但其对处理更精细细节或在较长视频中处理涉及多个主体的多动作 alignment 时,对幻觉的易感性显著增加。

关键词

引用

@article{arxiv.2509.08538,
  title  = {MESH -- Understanding Videos Like Human: Measuring Hallucinations in Large Video Models},
  author = {Garry Yang and Zizhe Chen and Man Hon Wong and Haoyu Lei and Yongqiang Chen and Zhenguo Li and Kaiwen Zhou and James Cheng},
  journal= {arXiv preprint arXiv:2509.08538},
  year   = {2025}
}