中文

VideoINSTA:基于信息时空推理的零样本长视频理解

计算机视觉与模式识别 2024-10-08 v2

摘要

在视频语言领域,近期利用零样本大型语言模型 (LLM) 进行视频理解的研究方法正在成为之前端到端模型的有力竞争者。然而,长视频理解因在扩展时间范围内进行复杂推理而具有独特挑战,即便是零样本 LLM 方法也难以应对。信息在长视频中的冗余问题引发了这样的问题:哪些具体信息对大型语言模型 (LLM) 至关重要,以及如何利用这些信息进行长视频分析中的复杂时空推理。我们提出了 VideoINSTA 框架,即 INformative Spatial-TemporAl Reasoning,用于零样本长视频理解。VideoINSTA 的贡献包括:(1) 采用 LLM 的零样本长视频理解框架;(2) 基于事件的时序推理和基于内容的时空推理方法,使 LLM 能够对视频中的时空信息进行推理;(3) 基于信息充分性和预测置信度的自反思信息推理方案,平衡时序因素。我们的模型在三个长视频问答基准测试中显著提升了当前研究的最新成果:EgoSchema、NextQA 和 IntentQA,也在开放问答数据集 ActivityNetQA 上取得优异成绩。代码已发布:https://github.com/mayhugotong/VideoINSTA。

关键词

引用

@article{arxiv.2409.20365,
  title  = {VideoINSTA: Zero-shot Long Video Understanding via Informative Spatial-Temporal Reasoning with LLMs},
  author = {Ruotong Liao and Max Erler and Huiyu Wang and Guangyao Zhai and Gengyuan Zhang and Yunpu Ma and Volker Tresp},
  journal= {arXiv preprint arXiv:2409.20365},
  year   = {2024}
}

备注

EMNLP 2024 Findings; 22 pages; Code: https://github.com/mayhugotong/VideoINSTA