叙事对齐的长篇视频问答
计算机视觉与模式识别
2026-03-23 v1
摘要
多模态大语言模型(MLLM)的近期进展导致了对长视频推理基准的激增。然而,大多数现有基准依赖局部线索,难以捕捉叙事推理能力,即跟踪意图、连接远处事件并重建整个电影中的因果链。我们引入NA-VQA,一个旨在评估长视频中深层时序和叙事推理的基准。NA-VQA包含88部完整长片电影和4400个开放式问答对,每个问答对都以多个证据片段 grounding,分为短期、中期或远期,以评估长程依赖。通过要求生成多场景答案,NA-VQA测试模型是否能够整合分散的叙事信息,而不仅仅依赖浅层模式匹配。为解决现有方法的局限性,我们提出了Video-NaRA框架,构建事件级别的链并在结构化记忆中存储,以便在推理时检索。大量实验表明,最先进的MLLM在需要远程证据的问题上表现不佳,这凸显了对显式叙事建模的需求。Video-NaRA通过最高提升3个百分点提高了长程推理性能,显示其在处理复杂叙事结构方面的有效性。我们将在发表后发布NA-VQA。
关键词
引用
@article{arxiv.2603.19481,
title = {Narrative Aligned Long Form Video Question Answering},
author = {Rahul Jain and Keval Doshi and Burak Uzkent and Garin Kessler},
journal= {arXiv preprint arXiv:2603.19481},
year = {2026}
}