中文

SlowFast-LLaVA:用于视频大语言模型的强大无训练基线

计算机视觉与模式识别 2024-09-17 v2

摘要

我们提出SlowFast-LLaVA(或简称为SF-LLaVA),是一个能够在不超过常用LLM令牌预算的前提下,联合捕获细粒度空间语义和长程时序上下文的无训练视频大语言模型(Video LLM)。这通过为视频LLM采用两流SlowFast输入设计得出,用于有效方式汇聚样本帧的特征。具体而言,Slow路径以低帧率提取特征,同时尽可能保留尽可能多的空间细节(例如12x24个标记),而Fast路径则在高帧率下使用更大的空间池化步幅(例如下采样6倍)以聚焦于运动线索。因此,该设计允许我们充分捕获有利于详细视频理解的空间和时序特征。实验结果表明,SF-LLaVA在广泛的视频任务上超越了现有的无训练方法。在某些基准测试中,它甚至实现了与最先进视频LLM(这些模型在视频数据集上进行了微调)相当甚至更好的性能。代码已公开:https://github.com/apple/ml-slowfast-llava。

关键词

引用

@article{arxiv.2407.15841,
  title  = {SlowFast-LLaVA: A Strong Training-Free Baseline for Video Large Language Models},
  author = {Mingze Xu and Mingfei Gao and Zhe Gan and Hong-You Chen and Zhengfeng Lai and Haiming Gang and Kai Kang and Afshin Dehghan},
  journal= {arXiv preprint arXiv:2407.15841},
  year   = {2024}
}

备注

Technical report