通过层次化标记压缩加速流式视频大语言模型
计算机视觉与模式识别
2026-02-12 v2
摘要
流式视频大语言模型(VideoLLMs)在各种视频理解任务上展现出惊人的性能,但在实际部署时因处理连续视频流中稠密视觉标记的高计算成本面临重大挑战。在流式视频场景中,主要瓶颈在于 Vision Transformer(ViT)编码阶段,冗余处理时序相似帧导致效率低下。此外,LLM 前填充阶段的膨胀标记序列进一步恶化了延迟和内存开销。为此,我们提出了 \textbf{S}treaming \textbf{T}oken \textbf{C}ompression (\textbf{STC}),一种即插即用的层次化框架,可无缝集成到现有的流式 VideoLLMs 中,优化 ViT 编码和 LLM 前填充阶段以加速处理。STC 引入两种标记级加速器:\textbf{STC-Cacher} 通过缓存和重用时序相似帧的特征来降低 ViT 编码开销;\textbf{STC-Pruner} 在标记进入 LLM 之前基于时空相关性保留最关键标记,以压缩视觉标记序列。对四个基准流式 VideoLLMs 在五个基准数据集上的大量实验表明,STC 在其他压缩方法中表现更优。显著的是,STC 在 ReKV 框架下保持最高可达 \textbf{99\%} 的准确率,同时将 ViT 编码延迟和 LLM 前填充延迟分别降低 \textbf{24.5\%} 和 \textbf{45.3\%}。
引用
@article{arxiv.2512.00891,
title = {Accelerating Streaming Video Large Language Models via Hierarchical Token Compression},
author = {Yiyu Wang and Xuyang Liu and Xiyan Gui and Xinying Lin and Boxue Yang and Chenfei Liao and Tailai Chen and Linfeng Zhang},
journal= {arXiv preprint arXiv:2512.00891},
year = {2026}
}
备注
Code is avaliable at \url{https://github.com/lern-to-write/STC}