QuickVideo:面向实时长视频理解的系统-算法联合设计
计算机视觉与模式识别
2025-06-03 v2 人工智能
摘要
长视频理解已成为视频监控、会议摘要、教育讲座分析和体育转播等实际应用中的关键能力。然而,由于两个瓶颈,VideoLLM的长视频理解仍然在计算上不可行:1)顺序视频解码,即将原始比特流转换为RGB帧的过程,对于小时级视频输入可能耗时最长近一分钟;2)LLM推理中高达数百万token的预填充,导致高延迟和高内存使用。在解决这些挑战方面,我们提出QuickVideo,一种系统-算法联合设计,显著加速长视频理解以支持实时下游应用。它包含三个关键创新:QuickDecoder,一种并行的基于CPU的视频解码器,通过将视频划分为关键帧对齐的区间并并行处理实现2-3倍加速;QuickPrefill,一种基于KV-cache剪枝的内存高效预填充方法,以支持更多帧且占用更少GPU内存;以及一种重叠方案,将CPU视频解码与GPU推理重叠。总体而言,这些组件将长视频输入的推理时间缩短一个月,使即使在有限硬件上也能实现可扩展的高质量视频理解。实验表明,QuickVideo在持续时间和抽样率方面具有广泛的可迁移性,使长视频处理在实际中变得可行。
关键词
引用
@article{arxiv.2505.16175,
title = {QuickVideo: Real-Time Long Video Understanding with System Algorithm Co-Design},
author = {Benjamin Schneider and Dongfu Jiang and Chao Du and Tianyu Pang and Wenhu Chen},
journal= {arXiv preprint arXiv:2505.16175},
year = {2025}
}
备注
19 pages, 6 figures, 2 tables