中文

MoReVQA:探索用于视频问答的模块化推理模型

计算机视觉与模式识别 2025-03-28 v2 人工智能 机器学习

摘要

本文通过分解的多阶段模块化推理框架来解决视频问答任务。以往的模块化方法在单一规划阶段中显示出前景,但未与视觉内容结合。然而,通过一个简单有效的基线,我们发现此类系统在具有挑战性的 videoQA 设置中实际应用时会导致脆弱的行为。因此,不同于传统的单阶段规划方法,我们提出了一个多阶段系统,包含事件解析器、定位阶段和与外部记忆结合的最终推理阶段。所有阶段均无需训练,并使用大模型的少样本提示执行,在每个阶段创建可解释的中间输出。通过分解底层的规划和任务复杂性,我们的方法 MoReVQA 在标准 videoQA 基准(NExT-QA、iVQA、EgoSchema、ActivityNet-QA)上改进了先前的工作并取得了 SOTA 结果,且可扩展至相关任务(grounded videoQA、段落描述)。

关键词

引用

@article{arxiv.2404.06511,
  title  = {MoReVQA: Exploring Modular Reasoning Models for Video Question Answering},
  author = {Juhong Min and Shyamal Buch and Arsha Nagrani and Minsu Cho and Cordelia Schmid},
  journal= {arXiv preprint arXiv:2404.06511},
  year   = {2025}
}

备注

CVPR 2024; updated NExT-GQA results in Appendix