中文

RAVU:基于图的组合推理检索增强视频理解

计算机视觉与模式识别 2025-05-07 v1 人工智能

摘要

理解长视频对于大型多模态模型(LMMs)而言仍然是一个重大挑战。由于缺乏显式的记忆和检索机制,当前的 LMM 甚至难以处理几分钟到几小时的视频。为了解决这一局限,我们提出了 RAVU(检索增强视频理解),这是一个通过时空图上的组合推理进行检索增强的视频理解新框架。我们构建了视频的图表示,捕捉实体之间的空间和时间关系。该图充当长期记忆,使我们能够跨时间跟踪对象及其动作。为了回答复杂查询,我们将查询分解为一系列推理步骤,并在图上执行这些步骤,检索相关的关键信息。我们的方法能够更准确地理解长视频,特别是对于需要多跳推理和跨帧跟踪对象的查询。在两个主要的视频问答数据集 NExT-QA 和 EgoSchema 上,我们的方法在使用有限检索帧(5-10 帧)的情况下,相比其他 SOTA 方法和基线展现了优越的性能。

关键词

引用

@article{arxiv.2505.03173,
  title  = {RAVU: Retrieval Augmented Video Understanding with Compositional Reasoning over Graph},
  author = {Sameer Malik and Moyuru Yamada and Ayush Singh and Dishank Aggarwal},
  journal= {arXiv preprint arXiv:2505.03173},
  year   = {2025}
}