LLaVA-Video:基于合成数据的视频指令调优
计算机视觉与模式识别
2025-08-04 v3 计算与语言
摘要
视频大型多模态模型(LMM)的发展受限于难以从网络上筛选大量高质量原始数据。为此,我们提出了另一种方法,即为视频指令跟随任务创建高质量的人工合成数据集,称为 LLaVA-Video-178K。该数据集包括详细描述、开放式问答(QA)和多选题问答等关键任务。通过在该数据集上进行训练,结合现有的视觉指令调优数据,我们介绍了 LLaVA-Video,一种新的视频 LMM。我们的实验表明,LLaVA-Video 在各种视频基准测试中取得优异性能,凸显了我们数据集的有效性。我们计划发布数据集、其生成管道以及模型检查点。
引用
@article{arxiv.2410.02713,
title = {LLaVA-Video: Video Instruction Tuning With Synthetic Data},
author = {Yuanhan Zhang and Jinming Wu and Wei Li and Bo Li and Zejun Ma and Ziwei Liu and Chunyuan Li},
journal= {arXiv preprint arXiv:2410.02713},
year = {2025}
}
备注
Project page: https://llava-vl.github.io/blog/2024-09-30-llava-video/; Accepted at TMLR