中文

面向多模态大语言模型的长视频理解:基于单次剪辑检索的有效方法

计算机视觉与模式识别 2026-04-10 v2

摘要

由于巨大的内存开销,大多数多模态大语言模型(MLLMs)只能处理帧数有限的视频。本文提出一种有效且高效的范式,以弥补这一不足,称为单次视频剪辑基于检索增强生成方法(OneClip-RAG)。与现有的视频检索增强生成方法相比,OneClip-RAG充分利用了视频剪辑在知识完整性和语义连贯性方面的优势。此外,它还配备了一种新颖的查询引导视频分块算法,可将剪辑分块和跨模态检索统一在一个处理步骤中,避免冗余计算。为提高指令遵循能力,我们进一步提出了名为SynLongVideo的新型数据集,并为OneClip-RAG设计了渐进式训练方案。将OneClip-RAG集成到三种最新的MLLMs中并在一组长视频基准测试上进行验证。实验结果不仅显示OneClip-RAG相对于MLLMs显著提升性能(例如,将Qwen3-VL 8B提升至GPT-5水平),而且在处理长视频方面表现出卓越的效率(例如,在单张4090 GPU上使LLaVA-Video能够在不到1.2分钟内理解最长达一小时的视频)。

关键词

引用

@article{arxiv.2512.08410,
  title  = {Towards Effective Long Video Understanding of Multimodal Large Language Models via One-shot Clip Retrieval},
  author = {Tao Chen and Shaobo Ju and Qiong Wu and Chenxin Fang and Kun Zhang and Jun Peng and Hui Li and Yiyi Zhou and Rongrong Ji},
  journal= {arXiv preprint arXiv:2512.08410},
  year   = {2026}
}