中文

LLaVA-Scissor:基于语义连通分量的视频大语言模型 token 压缩

计算机视觉与模式识别 2025-06-30 v1 人工智能 人机交互 多媒体

摘要

本文提出了 LLaVA-Scissor,一种面向视频多模态大语言模型的训练-free token 压缩策略。以往方法大多基于注意力得分尝试压缩 token,但未能有效捕获所有语义区域,往往导致 token 冗余。不同于此, 我们提出利用语义连通分量 (Semantic Connected Components, SCC) 方法,将 token 分配到 token 集合中的不同语义区域,以确保语义覆盖的全面性。其结果是一种基于 SCC 的双层时空 token 压缩策略, 在空间和时间域均运用 SCC。该策略通过代表整个视频的非重叠语义 token 集合,有效压缩了 token。我们在包括视频问答、长视频理解和综合多选基准等多项视频理解基准上,对 LLaVA-Scissor 的 token 压缩能力进行了广泛评估。实验结果表明,所提出的 LLaVA-Scissor 在各种视频理解基准中优于其他 token 压缩方法,尤其在低 token 保留比例下表现尤为突出。项目页面: https://github.com/HumanMLLM/LLaVA-Scissor。

关键词

引用

@article{arxiv.2506.21862,
  title  = {LLaVA-Scissor: Token Compression with Semantic Connected Components for Video LLMs},
  author = {Boyuan Sun and Jiaxing Zhao and Xihan Wei and Qibin Hou},
  journal= {arXiv preprint arXiv:2506.21862},
  year   = {2025}
}

备注

21 pages, 4 figures, 7 tables