RAG-Adapter:用于长视频理解的即插即用RAG增强框架
计算机视觉与模式识别
2025-03-12 v1
摘要
具备视频理解能力的多模态大语言模型(MLLM)正在快速发展。为有效评估其视频理解能力,提出了长视频理解基准,如Video-MME和MLVU。然而,这些基准直接使用均匀帧采样进行测试,导致大量信息丢失,影响了评估反映MLLM真实能力的准确性。为解决这一问题,我们提出了RAG-Adapter,一个即插即用框架,通过采样与给定问题最相关的帧来减少测试过程中的信息丢失。此外,我们引入分组监督对比学习(GCL)方法,通过对所构建的MMAT数据集进行微调,进一步增强RAG-Adapter的采样有效性。最后,我们在各种视频理解基准上测试了大量基线MLLM,发现RAG-Adapter采样始终优于均匀采样(例如,GPT-4o在Video-MME上的准确率提升了9.3%),为长视频基准提供了更准确的测试方法。
引用
@article{arxiv.2503.08576,
title = {RAG-Adapter: A Plug-and-Play RAG-enhanced Framework for Long Video Understanding},
author = {Xichen Tan and Yunfan Ye and Yuanjing Luo and Qian Wan and Fang Liu and Zhiping Cai},
journal= {arXiv preprint arXiv:2503.08576},
year = {2025}
}
备注
37 pages, 36 figures