MINERVA:评估复杂视频推理
机器学习
2025-05-02 v1 计算机视觉与模式识别
摘要
多模态 LLM 正将重心转向视频基准测试,然而大多数视频基准测试仅提供结果监督,缺乏中间或可解释的推理步骤。这使得评估模型是否真正能够结合感知与时间信息进行视频推理,还是仅凭偶然或利用语言偏差得到正确答案变得具有挑战性。为弥补这一不足,我们提供了一个名为 MINERVA 的新视频推理数据集,供现代多模态模型使用。该数据集中的每个问题均配有 5 个选项以及详细的人工制作推理轨迹。我们的数据集是多模态的,在视频领域和长度上具有多样性,并包含复杂的多步问题。广泛的基准测试表明,我们的数据集对前沿开源模型和专有模型均构成了挑战。我们进行了细粒度的错误分析,以识别各种模型常见的失败模式,并创建了推理错误分类法。我们利用该分类法探索了人类评分和 LLM-as-a-judge 方法在视频推理轨迹评分中的应用,发现失败模式主要与时间定位相关,其次是视觉感知错误,而非逻辑或完整性错误。该数据集连同问题、候选答案和推理轨迹将在 https://github.com/google-deepmind/neptune?tab=readme-ov-file\#minerva 上公开发布。
引用
@article{arxiv.2505.00681,
title = {MINERVA: Evaluating Complex Video Reasoning},
author = {Arsha Nagrani and Sachit Menon and Ahmet Iscen and Shyamal Buch and Ramin Mehran and Nilpa Jha and Anja Hauth and Yukun Zhu and Carl Vondrick and Mikhail Sirotenko and Cordelia Schmid and Tobias Weyand},
journal= {arXiv preprint arXiv:2505.00681},
year = {2025}
}