Video-Holmes:多模态大语言模型能否像福尔摩斯一样进行复杂视频推理?
计算机视觉与模式识别
2025-05-28 v1
摘要
近期在 CoT 推理和 RL 后训练方面的进展被报道可增强 MLLM 的视频推理能力。这一进展自然引出了一个问题:这些模型能否以类似于人类专家的方式进行复杂视频推理?然而,现有的视频基准主要评估视觉感知与定位能力,其问题可通过显式提示或孤立的视觉线索来回答。此类基准未能充分捕捉现实世界推理的复杂性,在现实推理中,人类必须主动搜索、整合并分析多个线索后才能得出结论。为解决此问题,我们提出了 Video-Holmes,一个受夏洛克·福尔摩斯推理过程启发的基准,旨在评估 MLLM 的复杂视频推理能力。Video-Holmes 包含源自 270 部人工标注悬疑短片的 1,837 个问题,涵盖七个精心设计的任务。每个任务的构建首先识别影片中的关键事件与因果关系,然后设计问题,要求模型主动定位并连接分散在不同视频片段中的多个相关视觉线索。我们对 SOTA MLLM 的全面评估表明,尽管这些模型通常擅长视觉感知,但在整合信息方面遇到巨大困难,且经常遗漏关键线索。例如,表现最佳的模型 Gemini-2.5-Pro 仅达到 45% 的准确率,大多数模型的得分低于 40%。我们希望 Video-Holmes 能作为多模态推理的“Holmes-test”,激励模型更像人类一样推理,并强调该领域面临的持续挑战。该基准发布于 https://github.com/TencentARC/Video-Holmes。
引用
@article{arxiv.2505.21374,
title = {Video-Holmes: Can MLLM Think Like Holmes for Complex Video Reasoning?},
author = {Junhao Cheng and Yuying Ge and Teng Wang and Yixiao Ge and Jing Liao and Ying Shan},
journal= {arXiv preprint arXiv:2505.21374},
year = {2025}
}
备注
Homepage: https://github.com/TencentARC/Video-Holmes