中文

Video-RAG: 视觉对齐的检索增强长视频理解

计算机视觉与模式识别 2025-11-25 v4 人工智能

摘要

现有的大型视频语言模型(LVLM)由于上下文限制难以正确理解长视频。为解决这一问题,微调长上下文LVLM和使用基于GPT的智能体已成为有前景的解决方案。然而,微调LVLM需要大量高质量数据和大量GPU资源,而基于GPT的智能体则依赖专有模型(如GPT-4o)。在本文中,我们提出视频检索增强生成(Video-RAG),一种无需训练且成本高效的流水线,它利用视觉对齐的辅助文本来促进跨模态对齐,同时提供超出视觉内容的额外信息。具体来说,我们利用开源外部工具从纯视频数据(如音频、光学字符和目标检测)中提取视觉对齐的信息,并将提取的信息作为辅助文本,以即插即用的方式与视频帧和查询一起融入现有的LVLM。我们的Video-RAG具有几个关键优势:(i) 由于单轮检索,计算开销低,轻量级;(ii) 易于实现且与任何LVLM兼容;(iii) 在长视频理解基准(包括Video-MME、MLVU和LongVideoBench)上取得显著且一致的性能提升。值得注意的是,当与72B模型一起使用时,我们的模型表现出优于Gemini-1.5-Pro和GPT-4o等专有模型的性能。

关键词

引用

@article{arxiv.2411.13093,
  title  = {Video-RAG: Visually-aligned Retrieval-Augmented Long Video Comprehension},
  author = {Yongdong Luo and Xiawu Zheng and Guilin Li and Shukang Yin and Haojia Lin and Chaoyou Fu and Jinfa Huang and Jiayi Ji and Fei Chao and Jiebo Luo and Rongrong Ji},
  journal= {arXiv preprint arXiv:2411.13093},
  year   = {2025}
}

备注

Accepted at NeurIPS 2025. Camera-ready version