E-VRAG: 利用资源高效的检索增强生成提升长视频理解
计算机视觉与模式识别
2025-08-05 v1
摘要
视觉语言模型(VLM)通过利用跨模态推理能力,在视频理解方面取得了显著进展。然而,其有效性受到有限上下文窗口以及处理包含数千帧的长视频所需的高计算成本的限制。检索增强生成(RAG)通过仅选择最相关的帧作为输入来应对这一挑战,从而减轻计算负担。尽管如此,现有的视频RAG方法在平衡检索效率和准确性方面仍存在困难,尤其是在处理多样且复杂的视频内容时。为了解决这些局限性,我们提出了E-VRAG,一种新颖且高效的用于视频理解的视频RAG框架。我们首先应用一种基于层次化查询分解的帧预过滤方法来消除不相关的帧,从而在数据层面降低计算成本。然后,我们采用轻量级VLM进行帧评分,进一步在模型层面降低计算成本。此外,我们提出了一种帧检索策略,该策略利用帧间评分的全局统计分布来减轻使用轻量级VLM可能带来的性能下降。最后,我们为检索到的帧引入了一种多视角问答方案,增强了VLM从长视频上下文中提取和理解信息的能力。在四个公开基准上的实验表明,与基线方法相比,E-VRAG在无需额外训练的情况下,实现了约70%的计算成本降低和更高的准确性。这些结果证明了E-VRAG在提高视频RAG任务的效率和准确性方面的有效性。
引用
@article{arxiv.2508.01546,
title = {E-VRAG: Enhancing Long Video Understanding with Resource-Efficient Retrieval Augmented Generation},
author = {Zeyu Xu and Junkang Zhang and Qiang Wang and Yi Liu},
journal= {arXiv preprint arXiv:2508.01546},
year = {2025}
}