面向VideoLLM的锐利视野与记忆:信息感知视觉token剪枝以实现高效可靠的视频LLM推理
计算机视觉与模式识别
2025-12-05 v2 人工智能
摘要
当前的视频大型语言模型(VideoLLM)因依赖处理过多冗余视觉token而 suffer 二次计算复杂度和key-value缓存扩张。为解决此问题,我们提出了SharpV,一种极简且高效的方法,用于自适应剪枝视觉token和KV缓存。与大多数统一压缩方法不同,SharpV基于空间-时间信息动态调整剪枝比例。令人惊讶的是,这种自适应机制偶尔可实现对密集模型的性能提升,提供了一种自适应剪枝的新范式。在KV缓存剪枝阶段,基于对视觉信息退化的观察,SharpV通过自校准方式修剪退化的视觉特征,受到与原始视觉特征相似性的指导。如此,SharpV从信息瓶颈的角度实现了分层缓存剪枝,为VideoLLM的信息流提供了新视角。在多个公开基准测试上的实验表明,SharpV的优势显而显著。此外,就我们所知,SharpV是首个无需访问公开注意力分数的两阶段剪枝框架,确保与诸如Flash Attention等硬件加速技术的完全兼容性。
引用
@article{arxiv.2511.08003,
title = {Sharp Eyes and Memory for VideoLLMs: Information-Aware Visual Token Pruning for Efficient and Reliable VideoLLM Reasoning},
author = {Jialong Qin and Xin Zou and Di Lu and Yibo Yan and Xuming Hu},
journal= {arXiv preprint arXiv:2511.08003},
year = {2025}
}
备注
The 40th Annual AAAI Conference on Artificial Intelligence (AAAI-26) Poster