中文

PPLLaVA:基于提示引导的多样化视频序列理解

计算机视觉与模式识别 2026-05-04 v4

摘要

在过去一年中,基于视频的大型语言模型(Video LLMs)取得了令人瞩目的进展,特别是在通过极长上下文长度处理长视频的能力方面。然而,由于大量视觉令牌的存在,这带来了显著增加的计算开销,使效率成为主要瓶颈。在本文中,我们识别出这种低效的根源在于视频内容的高冗余性。为解决这一问题,我们提出了一种新颖的池化策略,能够在保留指令相关视觉语义的同时实现激进的令牌压缩。我们的模型——提示引导池化LLaVA(PPLLaVA)——引入了三个关键组件:基于CLIP的视觉-提示对齐模块,根据用户指令识别感兴趣区域;提示引导池化机制,利用卷积式池化自适应压缩视觉序列;以及用于处理长而复杂提示的视觉对话上下文扩展模块。在最多18倍的令牌压缩下,PPLLaVA在多样化视频理解基准测试中保持了强劲性能——涵盖从图像到视频任务(如描述生成和问答)到长视频推理——同时显著提升了推理吞吐量。代码已发布于https://github.com/farewellthree/PPLLaVA。

关键词

引用

@article{arxiv.2411.02327,
  title  = {PPLLaVA: Varied Video Sequence Understanding With Prompt Guidance},
  author = {Shangkun Sun and Ruyang Liu and Haoran Tang and Yixiao Ge and Haibo Lu and Wei Gao and Jiankun Yang and Chen Li},
  journal= {arXiv preprint arXiv:2411.02327},
  year   = {2026}
}

备注

Accepted to ICLR' 26