中文

VideoMathQA:基于视频中多模态理解的数学推理基准

计算机视觉与模式识别 2025-06-25 v2

摘要

现实视频场景中的数学推理与静态图像或文本环境中的推理存在根本性差异。它需要解释细粒度的视觉信息,准确读取手写或数字文本,并整合随时间非线性分布的语音线索。在此类多模态上下文中,成功的关键不仅在于感知,更在于从丰富且噪声的流式内容中,精准地识别并整合正确的上下文细节。为此,我们引入 VideoMathQA,一个旨在评估模型是否能够在视频上进行此类时序扩展的跨模态推理的基准测试。该基准覆盖 10 个具有代表性的数学领域,涵盖时长从 10 秒到超过 1 小时的视频。它要求模型解释结构化视觉内容、理解指令叙事,并跨视觉、音频和文本模态进行概念联合定位。我们聘请了研究生级专家从事高质量标注,总计超过 920 小时的标注工作。为贴近现实场景,问题围绕三个核心推理挑战设计:直接问题求解,即答案基于所呈现的问题;概念迁移,需要将所学方法应用于新问题;深层指令理解,涉及对扩展解释和部分完成的解答的多步骤推理。每个问题均包含多步骤推理标注, enables 对模型能力进行细粒度诊断。通过该基准,我们揭示了现有方法的局限性,并为必须在时序扩展且模态丰富的数学问题场景中进行推理(而不仅仅是感知)的模型建立了系统评估框架。我们的基准和评估代码可在:https://mbzuai-oryx.github.io/VideoMathQA 查看。

关键词

引用

@article{arxiv.2506.05349,
  title  = {VideoMathQA: Benchmarking Mathematical Reasoning via Multimodal Understanding in Videos},
  author = {Hanoona Rasheed and Abdelrahman Shaker and Anqi Tang and Muhammad Maaz and Ming-Hsuan Yang and Salman Khan and Fahad Shahbaz Khan},
  journal= {arXiv preprint arXiv:2506.05349},
  year   = {2025}
}

备注

VideoMathQA Technical Report