面向超低保留率的 Video-LLM 统一时空 Token 压缩
计算机视觉与模式识别
2026-03-24 v1
摘要
视频大语言模型 (Video-LLM) 因大量视觉 Token 面临高计算成本。现有 Token 压缩方法通常采用两阶段时空压缩策略,依赖阶段特定指标并假设时空可分离。在极端低保留比率下,这些方法常导致分配不均并丢失答题所必需的视觉证据。我们将 Token 压缩重新表述为全局 Token 保留池内的时空分配任务。提出统一选择机制,整合注意力权重和语义相似性,对具有高贡献度和低冗余性的 Token 进行全局选择。未被选择的 Token 通过聚类合并并补充,以保留信息完整性。在 LLM 内部,进一步引入文本感知合并,基于查询相关性进行二次压缩。无需重新训练,我们的方法可作为兼容现有 Video-LLM 的即插即用模块。实验表明,仅保留约 2% 的视觉 Token 即可保持约 90.1% 的基线性能,FLOPs 降至约 2.6%。这些收益跨越多样化的 backbone,显著降低端到端推理延迟和内存消耗。我们的统一时空 Token 压缩策略在超低 Token 保留率下实现了视频理解的业界领先水平。
引用
@article{arxiv.2603.21957,
title = {Unified Spatiotemporal Token Compression for Video-LLMs at Ultra-Low Retention},
author = {Junhao Du and Jialong Xue and Anqi Li and Jincheng Dai and Guo Lu},
journal= {arXiv preprint arXiv:2603.21957},
year = {2026}
}
备注
Accepted by CVPR 2026