中文

Flash-VStream: 基于内存的长视频流实时理解

计算机视觉与模式识别 2024-07-02 v2

摘要

得益于大语言模型和跨模态对齐技术的发展,现有多模态视频理解方法在离线场景中取得了显著的性能。然而,作为现实世界中最常见的媒介形式的在线视频流,仍鲜有被关注。与离线视频相比,其“动态”特性为直接应用现有模型带来了挑战,并引入了新的问题,如对极长期信息的存储、连续视觉内容与“非同步”用户提问之间的交互。因此,本文提出Flash-VStream,一种模拟人类记忆机制的视频语言模型。我们的模型能够实时处理极长视频流,同时响应用户查询。与现有模型相比,Flash-VStream在推理延迟和VRAM消耗方面实现了显著降低,这与进行在线流媒体视频理解密切相关。此外,鉴于现有视频理解基准主要集中在离线场景,本文提出VStream-QA,一个专为在线视频流理解设计的新型问答基准。与该基准上流行方法的比较表明,我们的方法在这一具有挑战性的设置下具有优势。为验证我们方法的通用性,我们进一步在现有视频理解基准上进行评估,并在离线场景下实现了最先进的性能。所有代码、模型和数据集均可在 https://invinciblewyq.github.io/vstream-page/ 获取。

关键词

引用

@article{arxiv.2406.08085,
  title  = {Flash-VStream: Memory-Based Real-Time Understanding for Long Video Streams},
  author = {Haoji Zhang and Yiqin Wang and Yansong Tang and Yong Liu and Jiashi Feng and Jifeng Dai and Xiaojie Jin},
  journal= {arXiv preprint arXiv:2406.08085},
  year   = {2024}
}