中文

通过提升帧率到16帧每秒提高LLM视频理解能力

计算机视觉与模式识别 2025-06-19 v2

摘要

人类视觉是动态连续的。然而,在以多模态大语言模型(LLM)进行视频理解时,现有方法主要依赖于以帧率小于等于2 FPS(帧每秒)固定抽取的静态特征,导致严重的视觉信息丢失。本文引入F-16,首个面向高帧率视频理解的多模态LLM。通过将帧率提升至16 FPS 并压缩每个1秒片段中的视觉标记,F-16在高效捕获动态视觉特征的同时保留关键语义信息。实验结果表明,更高的帧率在多个基准测试中显著提升视频理解能力,为超越模型规模或训练数据扩张之外的提升视频LLM的新方法。F-16在70亿参数的视频LLM中实现了在Video-MME和TemporalBench等通用和细粒度视频理解基准上的领先性能。此外,F-16在复杂时空任务(如高速体育分析:篮球、足球、体操和 Diving)中表现出色,超越了GPT-4o和Gemini-1.5-pro等专有视觉模型。我们还引入了F-16的一种新型解码方法,使其能够在不需模型再训练的情况下实现高效的低帧率推理。我们将在 https://github.com/bytedance/F-16 上发布源码、模型检查点和数据。

关键词

引用

@article{arxiv.2503.13956,
  title  = {Improving LLM Video Understanding with 16 Frames Per Second},
  author = {Yixuan Li and Changli Tang and Jimin Zhuang and Yudong Yang and Guangzhi Sun and Wei Li and Zejun Ma and Chao Zhang},
  journal= {arXiv preprint arXiv:2503.13956},
  year   = {2025}
}