面向长时段多模态视频理解的数学基准与智能体框架
计算机视觉与模式识别
2025-12-22 v1
摘要
长形式多模态视频理解需要将视觉、语音和环境音频与连贯的长程推理相结合。现有基准要么侧重时间长度,要么侧重多模态丰富性,二者很少同时兼顾。虽然一些基准包含开放式问题和先进指标,但大多依赖单一准确率分数,掩盖了失效模式。我们引入LongShOTBench,这是一个包含开放式、意图驱动问题;单轮与多轮对话;以及需要跨视频、音频和语音进行多模态推理和智能体工具使用的任务的诊断性基准。每个样本均包含参考答案和评分标准,以实现可解释且可追溯的评估。LongShOTBench通过可扩展的人类验证管道生成,确保覆盖范围和可重复性。我们的所有样本均经过人类验证和校正。此外,我们提出LongShOTAgent,一个通过预处理、搜索和迭代细化来分析长视频的智能体系统。在LongShOTBench上,最新多模态大语言模型显示出显著差距:Gemini-2.5-Flash达到52.95%,开源模型仍低于30%,而LongShOTAgent达到44.66%。这些结果凸显了现实世界长形式视频理解的难度。LongShOTBench为评估和改进MLLMs提供了实用且可重复的基础。所有资源均已发布于GitHub:https://github.com/mbzuai-oryx/longshot。
引用
@article{arxiv.2512.16978,
title = {A Benchmark and Agentic Framework for Omni-Modal Reasoning and Tool Use in Long Videos},
author = {Mohammed Irfan Kurpath and Jaseel Muhammad Kaithakkodan and Jinxing Zhou and Sahal Shaji Mullappilly and Mohammad Almansoori and Noor Ahsan and Beknur Kalmakhanbet and Sambal Shikhar and Rishabh Lalla and Jean Lahoud and Mariette Awad and Fahad Shahbaz Khan and Salman Khan and Rao Muhammad Anwer and Hisham Cholakkal},
journal= {arXiv preprint arXiv:2512.16978},
year = {2025}
}