中文

LiveVLM: 基于流式 KV 缓存与检索的高效在线视频理解

计算机视觉与模式识别 2026-04-24 v2

摘要

近期发展的视频大语言模型(Video LLM)已能够处理时长数小时的视频并展现卓越性能。然而,KV 缓存随时间线性增长,导致巨大的内存开销和响应延迟--这在各种实际在线应用中都是关键挑战,如 Deepseek 服务、自动驾驶和机器人领域。为缓解这些问题,本文提出了 LiveVLM,一个无需训练、对查询不敏感的专为在线视频理解和实时交互设计的框架。LiveVLM 采用视觉沉淀分块(VSB)机制实现实时视频流处理,保留长期视频细节并消除冗余 KV。该机制以视觉注意力得分作为度量标准, seeks 在压缩过程中最大化情境信息覆盖。注意到以查询不敏感的方式压缩的 KV 缓存不可避免地保留了针对特定查询无关的信息, LiveVLM 引入位置无关 KV 检索(PaR)机制以减少冗余情境的干扰。PaR 的关键在于解耦位置嵌入以增强 key 张量之间的相似性,从而支持按页面粒度的高效检索。大量实验表明,LiveVLM 使基础 LLaVA-OneVision 模型在训练免费查询不敏感方法和训练式在线模型中实现了最先进的准确率。

关键词

引用

@article{arxiv.2505.15269,
  title  = {LiveVLM: Efficient Online Video Understanding via Streaming-Oriented KV Cache and Retrieval},
  author = {Zhenyu Ning and Guangda Liu and Qihao Jin and Chengwei Li and Wenchao Ding and Minyi Guo and Jieru Zhao},
  journal= {arXiv preprint arXiv:2505.15269},
  year   = {2026}
}

备注

Accepted by DAC'26