中文

面向实时程序性视频理解的高效流式 VideoLLM

计算机视觉与模式识别 2025-04-22 v1

摘要

我们提出了 ProVideLLM,一个用于实时程序性视频理解的端到端框架。ProVideLLM 集成了一个多模态缓存,用于存储两种类型的 token—— verbalized 文本 token 提供对长期观察的压缩文本摘要,视觉 token 采用 DETR-QFormer 编码以捕获来自短期观察的细粒度细节。该设计在表示一小时的长期观察时,比现有方法降低了 22 倍的 token 数量,同时有效地编码了当前细粒度的信息。通过在多模态缓存中交错这些 token,ProVideLLM 确保了视频长度与内存和计算量的亚线性比例增长,使其能够以 10 FPS 的帧率进行 per-frame 流式推理和以 25 FPS 的速度进行流式对话,仅需约 2GB 的 GPU 内存即可实现。ProVideLLM 还在四个数据集上的六个程序性任务上取得了新的最先进结果。

关键词

引用

@article{arxiv.2504.13915,
  title  = {Memory-efficient Streaming VideoLLMs for Real-time Procedural Video Understanding},
  author = {Dibyadip Chatterjee and Edoardo Remelli and Yale Song and Bugra Tekin and Abhay Mittal and Bharat Bhatnagar and Necati Cihan Camgöz and Shreyas Hampali and Eric Sauser and Shugao Ma and Angela Yao and Fadime Sener},
  journal= {arXiv preprint arXiv:2504.13915},
  year   = {2025}
}

备注

13 pages, 5 figures; https://dibschat.github.io/ProVideLLM