中文

Flash-VStream:长视频流的高效实时理解

计算机视觉与模式识别 2025-07-25 v2

摘要

受大型语言模型和跨模态对齐的推动,现有多模态大语言模型在图像和短视频理解方面取得了显著成绩。然而,长视频的理解仍具有挑战性,因为其长时序性质导致显著的计算和内存开销。大多数现有工作将长视频与短视频相同方式处理,对于现实应用和即使更长的视频泛化都不够高效。为此,我们提出 Flash-VStream,一种能够处理极长视频并实时响应用户查询的高效视频语言模型。特别地,我们设计了 Flash 记忆模块,其中包含低容量上下文记忆来聚合长时序信息并建模信息密度分布,以及高容量增强记忆基于该分布检索详细的空间信息。与现有模型相比,Flash-VStream 在推理延迟方面显著降低。大量实验在长视频基准测试和综合视频基准测试中进行,即 EgoSchema、MLVU、LVBench、MVBench 和 Video-MME,证明了该方法的领先性能和卓越效率。代码已公开:https://github.com/IVGSZ/Flash-VStream。

关键词

引用

@article{arxiv.2506.23825,
  title  = {Flash-VStream: Efficient Real-Time Understanding for Long Video Streams},
  author = {Haoji Zhang and Yiqin Wang and Yansong Tang and Yong Liu and Jiashi Feng and Xiaojie Jin},
  journal= {arXiv preprint arXiv:2506.23825},
  year   = {2025}
}

备注

Accepted by ICCV 2025