中文

LLaVA-Video:基于合成数据的视频指令调优

计算机视觉与模式识别 2025-08-04 v3 计算与语言

摘要

视频大型多模态模型(LMM)的发展受限于难以从网络上筛选大量高质量原始数据。为此,我们提出了另一种方法,即为视频指令跟随任务创建高质量的人工合成数据集,称为 LLaVA-Video-178K。该数据集包括详细描述、开放式问答(QA)和多选题问答等关键任务。通过在该数据集上进行训练,结合现有的视觉指令调优数据,我们介绍了 LLaVA-Video,一种新的视频 LMM。我们的实验表明,LLaVA-Video 在各种视频基准测试中取得优异性能,凸显了我们数据集的有效性。我们计划发布数据集、其生成管道以及模型检查点。

关键词

引用

@article{arxiv.2410.02713,
  title  = {LLaVA-Video: Video Instruction Tuning With Synthetic Data},
  author = {Yuanhan Zhang and Jinming Wu and Wei Li and Bo Li and Zejun Ma and Ziwei Liu and Chunyuan Li},
  journal= {arXiv preprint arXiv:2410.02713},
  year   = {2025}
}

备注

Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR