中文

UpstreamQA:用于视频问答任务的显式推理模块化框架

计算机视觉与模式识别 2026-04-28 v1 人工智能

摘要

视频问答(VideoQA)需要模型能够联合推理空间、时间和语言线索。然而,该任务的内在复杂性通常需要多步推理,而当前的大型多模态模型(LMMs)进行的是隐式推理,导致其内部决策过程不透明。相比之下,大型推理模型(LRMs)显式生成中间逻辑步骤,不仅增强可解释性,还可提高多跳推理准确率。然而,这些模型并非为原生视频理解而设计,通常依赖静态帧采样。我们提出UpstreamQA,一种模块化框架,通过显式上游推理模块来解耦和评估核心视频推理组件。具体而言,我们采用多模态LRM执行对象识别和场景上下文生成,将丰富的推理痕迹传递给下游LMMs进行VideoQA。我们在OpenEQA和NExTQA数据集上评估了UpstreamQA,使用两种LRM(o4-mini、Gemini 2.5 Pro)和两种LMMs(GPT-4o、Gemini 2.5 Flash)。我们的结果表明,引入显式推理可以显著提升下游VideoQA的性能和可解释性,但在基线性能已相当高时也可能导致性能下降。总体而言,UpstreamQA为结合显式推理与多模态理解提供了原则性框架,推动了VideoQA在多个场景中的性能和诊断透明度的提升。

关键词

引用

@article{arxiv.2604.23145,
  title  = {UpstreamQA: A Modular Framework for Explicit Reasoning on Video Question Answering Tasks},
  author = {Jason Nguyen and Ameet Rao and Alexander Chang and Ishaan Kumar and Erin Tan},
  journal= {arXiv preprint arXiv:2604.23145},
  year   = {2026}
}