Vgent:基于图的检索-推理-增强生成用于长视频理解
计算机视觉与模式识别
2025-10-17 v1
摘要
由于难以处理超出上下文窗口的密集视频令牌以及保持长期顺序信息,大型视频语言模型(LVLMs)在处理长视频时面临显著挑战。检索增强生成(RAG)在处理大型语言模型的长文本上下文方面已显示出有效性;然而将RAG应用于长视频时,仍面临时间依赖性被破坏以及包含无关信息阻碍准确推理等挑战。为此,我们提出了Vgent——一种 novel 的基于图的检索-推理-增强生成框架,以增强LVLMs进行长视频理解。我们的方法引入了两个关键创新:(i) 通过结构化图表示视频,保留跨视频片段的语义关系以提高检索效果;(ii) 引入中间推理步骤以缓解LVLMs的推理限制,利用结构化验证减少检索噪声,并促进跨片段相关信息的显式聚合,从而产生更准确、更具上下文感知的响应。在三个长视频理解基准测试中,我们全面评估了该框架,并使用各种开源LVLMs进行测试。我们的方法在MLVU上整体性能提升了,并超越了最先进的视频RAG方法了。我们的代码已公开发布于https://xiaoqian-shen.github.io/Vgent。
引用
@article{arxiv.2510.14032,
title = {Vgent: Graph-based Retrieval-Reasoning-Augmented Generation For Long Video Understanding},
author = {Xiaoqian Shen and Wenxuan Zhang and Jun Chen and Mohamed Elhoseiny},
journal= {arXiv preprint arXiv:2510.14032},
year = {2025}
}
备注
NeurIPS 2025 (Spotlight). Webpage at https://xiaoqian-shen.github.io/Vgent