中文

基于最小视频对的面向物理理解的捷径感知视频问答基准

计算机视觉与模式识别 2025-06-12 v1 机器学习

摘要

现有用于评估视频语言模型时空理解和推理能力的基准容易因存在基于表面视觉或文本线索的捷径解决方案而产生分数膨胀。本文通过引入最小视频对(MVP)基准来缓解准确评估模型性能的挑战,这是一个简单的捷径感知视频问答基准,用于评估视频语言模型的物理理解能力。该基准包含55K个高质量多选题视频问答示例,聚焦于物理世界理解。示例来自九个视频数据源,涵盖第一人称自我中心视频和第三人称视角视频、机器人交互数据以及认知科学直觉物理基准。为缓解依赖表面视觉或文本线索和偏差的捷径解决方案,MVP中的每个样本都配有一个最小变化对——一个视觉相似的视频,配以相同的问题但相反的答案。要正确回答问题,模型必须对最小变化对中的两个示例都给出正确答案;因此,仅依赖视觉或文本偏差的模型将低于随机性能。人类在MVP上的表现为92.9%,而最佳开源最先进视频语言模型的表现为40.2%,随机性能为25%。

关键词

引用

@article{arxiv.2506.09987,
  title  = {A Shortcut-aware Video-QA Benchmark for Physical Understanding via Minimal Video Pairs},
  author = {Benno Krojer and Mojtaba Komeili and Candace Ross and Quentin Garrido and Koustuv Sinha and Nicolas Ballas and Mahmoud Assran},
  journal= {arXiv preprint arXiv:2506.09987},
  year   = {2025}
}