中文

通过视觉记忆机制扩展多模态大语言模型的长视频理解能力

计算机视觉与模式识别 2026-04-01 v1 人工智能

摘要

长视频理解是制约多模态大语言模型 (MLLMs) 发展的关键挑战。在本文中,我们从视觉记忆机制的角度出发,提出了一种新颖且无需训练的 method,称为 \emph{Flexible Memory} (FlexMem)。原则上,FlexMem旨在模仿人类观看视频的行为,即持续观看视频内容并回想最相关的记忆片段来回答问题。如此一来,FlexMem 可以帮助 MLLMs 实现视频理解的无限长度,而与之前处理所有视频信息并存在输入上限的方法不同。具体而言,FlexMem 首先将视觉 KV 缓存视为记忆来源,通过双通道压缩 design 实现有效的记忆传递和写入。随后,FlexMem 还探索了针对不同视频理解任务的不同记忆读取策略,包括流行的 streaming 方法。为验证 FlexMem,我们将其应用于两类流行视频-MLLMs,并在五个长视频和一个 streaming 视频任务上进行大量实验。实验结果表明,在单张 3090 GPU 上,我们的 FlexMem 能显著优于现有高效视频理解方法,处理超过 \textbf{1k 框},这也帮助底层 MLLMs 在某些基准测试上(如 GPT-4o 和 Gemini-1.5 Pro)实现与 SOTA MLLMs 相当甚至更好的性能。

关键词

引用

@article{arxiv.2603.29252,
  title  = {Scaling the Long Video Understanding of Multimodal Large Language Models via Visual Memory Mechanism},
  author = {Tao Chen and Kun Zhang and Qiong Wu and Xiao Chen and Chao Chang and Xiaoshuai Sun and Yiyi Zhou and Rongrong Ji},
  journal= {arXiv preprint arXiv:2603.29252},
  year   = {2026}
}

备注

CVPR 2026