中文

AdaTP:面向视频大型语言模型的注意力去偏令牌剪枝

计算机视觉与模式识别 2025-05-27 v1 人工智能

摘要

视频大型语言模型(Video LLM)在视频理解任务中取得了显著的成果。然而,由于多帧视频产生的大量视觉令牌,它们通常面临沉重的计算开销。现有的视觉令牌压缩方法通常依赖语言模型的注意力分数作为指导。然而,这些分数表现出固有的偏差:全局偏差反映为倾向于关注视觉令牌序列的两端,而局部偏差则导致在不同帧之间过度集中于相同的空间位置。为了解决注意力偏差问题,我们提出了面向视频大型语言模型的注意力去偏令牌剪枝(AdaTP),一种用于 Video LLM 的新型令牌剪枝流程。AdaTP 将两个专用的去偏模块集成到流程中,分别针对全局注意力偏差和局部注意力偏差。无需额外训练,我们的方法在保留原始模型性能的同时,显著降低了 Video LLM 的计算开销。广泛的评估表明,AdaTP 在各种常用的视频理解基准中取得了最先进的性能。特别是,在 LLaVA-OneVision-7B 上,AdaTP 在与原始模型相比仅使用高达 27.3%27.3\% FLOPs 的情况下,保持了性能且没有下降。我们的代码即将发布。

关键词

引用

@article{arxiv.2505.20100,
  title  = {AdaTP: Attention-Debiased Token Pruning for Video Large Language Models},
  author = {Fengyuan Sun and Leqi Shen and Hui Chen and Sicheng Zhao and Jungong Han and Guiguang Ding},
  journal= {arXiv preprint arXiv:2505.20100},
  year   = {2025}
}