中文

视频 needle 在 haystack 中: 视频大语言模型可扩展合成评估器

计算机视觉与模式识别 2025-03-10 v3

摘要

视频理解是多模态大语言模型(MLLMs)的关键下一步。各类基准测试被引入以更好地评估 MLLMs。然而,当前的视频基准在迭代开发期间仍不够高效,主要由于构建数据集成本高且难以隔离特定技能。本文提出 VideoNIAH(Video Needle In A Haystack),通过合成视频生成构建基准框架。VideoNIAH 通过插入无关的视觉 needle 到原始视频中,将视频内容与查询-响应解耦。该框架利用预定义规则自动生成查询-响应对,最小化人工劳动。查询聚焦于视频理解的特定方面,实现更具技能针对性的评估。视频内容与查询之间的分离还允许视频多样性增加,并可跨不同长度进行评估。利用 VideoNIAH,我们编译了包括检索、排序和计数等任务的视频基准 VNBench,用于评估视频理解的三个关键方面:时空感知、时间顺序和时空一致性。我们对 proprietary 和开源模型进行了全面评估,发现其在各种任务中的视频理解能力存在显著差异。此外,我们对测试结果和模型配置进行了深入分析。基于这些发现,我们提供了一些改进视频 MLLM 训练的建议,为未来研究和模型开发提供了宝贵见解。代码和数据已公开于 https://github.com/joez17/VideoNIAH。

关键词

引用

@article{arxiv.2406.09367,
  title  = {Needle In A Video Haystack: A Scalable Synthetic Evaluator for Video MLLMs},
  author = {Zijia Zhao and Haoyu Lu and Yuqi Huo and Yifan Du and Tongtian Yue and Longteng Guo and Bingning Wang and Weipeng Chen and Jing Liu},
  journal= {arXiv preprint arXiv:2406.09367},
  year   = {2025}
}

备注

ICLR 2025