LongViTU:用于长形式视频理解的指令调优
计算机视觉与模式识别
2025-03-28 v2 机器学习
摘要
本文介绍了 LongViTU,一个大规模(约12.1万对问答,约900小时视频)的自动生成数据集,用于长形式视频理解。我们提出了一种系统性的方法,将视频组织成层次化树结构以生成问答,并纳入自我修订机制以确保高质量的问答对。LongViTU 中的每个问答对特点包括:1)长期上下文(平均证书长度为4.6分钟);2)丰富的知识和浓缩的推理(常识、因果、计划等)。我们还为每个问答对提供了明确的时间戳注释。我们对 LongViTU 进行了大规模的人类研究,结果证明了我们数据集的质量。为更好地评估 LongViTU 强调长期上下文和浓缩推理所带来的挑战,我们人工筛选了一部分 LongViTU 数据构成基准测试。使用最新开源模型(LongVU)、专有模型(Gemini-1.5-Pro)和人类标注员进行评估,分别得到 GPT-4 分数为 49.9、52.3 和 81.0,凸显了 LongViTU 提问所带来的巨大难度。对 LongVU 和 LLaVA-Video 在 LongViTU 数据上的监督微调(SFT),在一系列长视频理解基准(EgoSchema、VideoMME-Long、MLVU、LVBench)上分别获得平均性能提升 2.5% 和 3.7%。
引用
@article{arxiv.2501.05037,
title = {LongViTU: Instruction Tuning for Long-Form Video Understanding},
author = {Rujie Wu and Xiaojian Ma and Hai Ci and Yue Fan and Yuxuan Wang and Haozhe Zhao and Qing Li and Yizhou Wang},
journal= {arXiv preprint arXiv:2501.05037},
year = {2025}
}