中文

用于长视频理解的生成式帧采样器

计算机视觉与模式识别 2025-09-03 v2 多媒体

摘要

尽管视频大语言模型(VideoLLMs)近期取得了进展,但有效理解长视频仍然是一个重大挑战。感知包含数千帧的长视频带来了巨大的计算负担。为了缓解这一问题,本文引入了生成式帧采样器,这是一个与 VideoLLM 集成的即插即用模块,旨在促进高效的长视频感知。GenS 建立在轻量级 VideoLLM 之上,利用其固有的视觉-语言能力来识别与问题相关的帧。为了促进有效检索,我们构建了 GenS-Video-150K,一个带有密集帧相关性注释的大规模视频指令数据集。大量实验表明,GenS 持续提升了各种 VideoLLM 的性能,包括开源模型(Qwen2-VL-7B、Aria-25B、VILA-40B、LLaVA-Video-7B/72B)和专有助手(GPT-4o、Gemini)。配备 GenS 后,开源 VideoLLM 在长视频基准上取得了令人印象深刻的 SOTA 结果:LLaVA-Video-72B 在 LongVideoBench 上达到 66.8 (+4.3),在 MLVU 上达到 77.0 (+2.7),而 Aria 在 HourVideo 上取得 39.2 分,超过 Gemini-1.5-pro 1.9 分。我们将在 https://generative-sampler.github.io 发布所有数据集和模型。

关键词

引用

@article{arxiv.2503.09146,
  title  = {Generative Frame Sampler for Long Video Understanding},
  author = {Linli Yao and Haoning Wu and Kun Ouyang and Yuanxing Zhang and Caiming Xiong and Bei Chen and Xu Sun and Junnan Li},
  journal= {arXiv preprint arXiv:2503.09146},
  year   = {2025}
}

备注

ACL 2025 Findings. Code: https://github.com/yaolinli/GenS