VideoEspresso:基于核心帧选择的大规模视频链式思维数据集
计算机视觉与模式识别
2024-11-25 v1 人工智能
计算与语言
摘要
大型视觉语言模型 (LVM) 的不断进步显著提升了多模态理解能力,但在视频推理任务中仍面临挑战,因为缺乏高质量的大规模数据集。现有的视频问答 (VideoQA) 数据集要么依赖昂贵的手动标注且细粒度不足,要么采用自动构建方法导致逐帧分析冗余,限制了其可扩展性和对复杂推理的有效性。为此,我们引入 VideoEspresso,一个新型数据集,包含保留关键空间细节和时间一致性的 VideoQA 对,以及中介推理步骤的多模态标注。我们的构建管道采用语义感知方法减少冗余度,随后使用 GPT-4o 生成 QA 对。我们进一步开发视频链式思维 (CoT) 标注,以丰富推理过程,引导 GPT-4o 从 QA 对和视频内容中提取逻辑关系。为了充分利用高质量 VideoQA 对,我们提出一种混合 LVM 协作框架,包括帧选择器和两个阶段指令微调的推理 LVM。该框架能够自适应选择核心帧并利用多模态证据进行 CoT 推理。在我们提出的基准测试中评估了 14 项任务,对比 9 个流行 LVM,本方法在大多数任务上超越了现有基线,展示了卓越的视频推理能力。我们的代码和数据集将在:https://github.com/hshjerry/VideoEspresso 上发布。
引用
@article{arxiv.2411.14794,
title = {VideoEspresso: A Large-Scale Chain-of-Thought Dataset for Fine-Grained Video Reasoning via Core Frame Selection},
author = {Songhao Han and Wei Huang and Hairong Shi and Le Zhuo and Xiu Su and Shifeng Zhang and Xu Zhou and Xiaojuan Qi and Yue Liao and Si Liu},
journal= {arXiv preprint arXiv:2411.14794},
year = {2024}
}
备注
14 pages, 14 figures