中文

RAG-Adapter:用于长视频理解的即插即用RAG增强框架

计算机视觉与模式识别 2025-03-12 v1

摘要

具备视频理解能力的多模态大语言模型(MLLM)正在快速发展。为有效评估其视频理解能力,提出了长视频理解基准,如Video-MME和MLVU。然而,这些基准直接使用均匀帧采样进行测试,导致大量信息丢失,影响了评估反映MLLM真实能力的准确性。为解决这一问题,我们提出了RAG-Adapter,一个即插即用框架,通过采样与给定问题最相关的帧来减少测试过程中的信息丢失。此外,我们引入分组监督对比学习(GCL)方法,通过对所构建的MMAT数据集进行微调,进一步增强RAG-Adapter的采样有效性。最后,我们在各种视频理解基准上测试了大量基线MLLM,发现RAG-Adapter采样始终优于均匀采样(例如,GPT-4o在Video-MME上的准确率提升了9.3%),为长视频基准提供了更准确的测试方法。

关键词

引用

@article{arxiv.2503.08576,
  title  = {RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding},
  author = {Xichen Tan and Yunfan Ye and Yuanjing Luo and Qian Wan and Fang Liu and Zhiping Cai},
  journal= {arXiv preprint arXiv:2503.08576},
  year   = {2025}
}

备注

37 pages, 36 figures