AdaVideoRAG:面向长视频理解的全情境自适应检索增强高效框架
计算机视觉与模式识别
2025-11-25 v3
摘要
多模态大语言模型(MLLMs)在视频理解方面表现良好,但由于固定长度上下文和较弱的长期依赖建模,在处理长视频时性能下降。检索增强生成(RAG)可以动态扩展知识,但现有的视频RAG方案采用固定检索范式,忽略查询难度,这种统一设计会导致简单查询产生冗余计算和延迟,而对于复杂的多跳推理则检索不够粗糙,从而严重限制了效率与认知深度之间的权衡。我们提出AdaVideoRAG,一个用于长视频理解的自适应RAG框架。一个轻量级意图分类器根据查询复杂度从最简单到最复杂动态选择合适的检索方案。我们设计了一个全息知识索引模块,将多模态信息提取并组织为三个数据库:(1)基于片段标题、ASR和OCR构建的文本库;(2)视觉库;(3)用于深层语义理解的知识图谱。该设计支持从粗糙检索到图基检索的层次化知识访问,在资源成本和推理能力之间进行权衡。为评估深层理解,我们进一步构建了HiVU基准。实验表明,AdaVideoRAG在长视频问答任务中显著提升了效率和准确性,可以通过轻量级API无缝集成到现有MLLMs中,建立一种新的自适应检索增强视频分析范式。
引用
@article{arxiv.2506.13589,
title = {AdaVideoRAG: Omni-Contextual Adaptive Retrieval-Augmented Efficient Long Video Understanding},
author = {Zhucun Xue and Jiangning Zhang and Xurong Xie and Yuxuan Cai and Yong Liu and Xiangtai Li and Dacheng Tao},
journal= {arXiv preprint arXiv:2506.13589},
year = {2025}
}
备注
NeurIPS 2025