中文

用于训练自由加速视频大型语言模型的多粒度时空 Token 合并

计算机视觉与模式识别 2025-07-11 v1 人工智能

摘要

视频大型语言模型 (LLM) 通过利用大量时空 token 实现强大的视频理解能力,但因 token 数量呈二次计算规模增长。为此,我们提出了一种训练自由的时空 token 合并方法,命名为 STTM。我们的关键洞察是利用视频数据中被忽视的局部空间和时间冗余性。STTM 首先通过在四分树结构上进行粗到细搜索,将每个帧转换为多粒度空间 token,然后在时空维度上进行有向成对合并。这种分解式合并方法在六个视频问答基准测试中超越了现有的 token 降维方法。值得注意的是,STTM 在 50% token 预算下仅有 0.5% 的准确率下降即可实现 2 倍加速,在 30% 预算下仅有 2% 的下降即可实现 3 倍加速。此外,STTM 是查询无关的,允许对同一视频的不同问题复用 KV 缓存。项目页面可访问于 https://www.jshyun.me/projects/sttm。

关键词

引用

@article{arxiv.2507.07990,
  title  = {Multi-Granular Spatio-Temporal Token Merging for Training-Free Acceleration of Video LLMs},
  author = {Jeongseok Hyun and Sukjun Hwang and Su Ho Han and Taeoh Kim and Inwoong Lee and Dongyoon Wee and Joon-Young Lee and Seon Joo Kim and Minho Shim},
  journal= {arXiv preprint arXiv:2507.07990},
  year   = {2025}
}

备注

Accepted at ICCV2025; Project page: https://www.jshyun.me/projects/sttm