中文

Video-Panda:面向无编码视频语言模型的参数高效对齐

计算机视觉与模式识别 2025-03-28 v2

摘要

我们提出了一种高效的无编码方法,用于视频语言理解,同时显著降低计算开销。当前的视频语言模型通常依赖重型图像编码器(300M-1.1B参数)或视频编码器(1B-1.4B参数),在处理多帧视频时造成巨大的计算负担。我们的方法引入了一种新颖的时空对齐模块(STAB),直接处理视频输入,而无需预训练编码器,仅使用45M参数进行视觉处理——相较于传统方法至少降低6.5倍。STAB架构结合了局部时空编码用于细粒度特征提取,通过学习注意力和独立机制实现高效的空间下采样,分别建模帧级和视频级关系。我们的模型在标准基准测试上实现了与编码器方法相当或更好的性能。细粒度视频问答评估显示,我们模型的有效性, 在正确性和时序理解等关键方面超越了基于编码器的 Video-ChatGPT 和 Video-LLaVA。大量消融研究验证了我们的架构选择,并展示了我们时空建模方法的有效性,同时比以前的方法快3-4倍。代码已公开 https://jh-yi.github.io/Video-Panda。

关键词

引用

@article{arxiv.2412.18609,
  title  = {Video-Panda: Parameter-efficient Alignment for Encoder-free Video-Language Models},
  author = {Jinhui Yi and Syed Talal Wasim and Yanan Luo and Muzammal Naseer and Juergen Gall},
  journal= {arXiv preprint arXiv:2412.18609},
  year   = {2025}
}

备注

CVPR 2025 camera-ready version