中文

使用 VIP 逐帧思考:一个用于评估视频思维链的视频填充与预测数据集

计算与语言 2023-11-10 v3 计算机视觉与模式识别

摘要

尽管近期令人振奋的研究结果表明视觉-语言系统能够使用自然语言对图像进行推理,但其视频推理能力仍待充分探索。我们主张将视频推理构建为对少量关键帧的序列理解,从而利用视觉-语言的能力与鲁棒性,同时缓解处理视频所带来的计算复杂性。为评估这一新颖应用,我们引入了 VIP,一个推理时挑战数据集,旨在通过视频思维链探究模型的推理能力。受视觉描述性场景剧本的启发,我们提出两种关键帧描述格式:非结构化密集字幕,以及识别关键帧焦点、动作、情绪、物体与场景(FAMOuS)的结构化场景描述。为评估视频推理,我们提出两项任务:视频填充与视频预测,分别测试生成多个中间关键帧与预测未来关键帧的能力。我们在 VIP 上基准测试了 GPT-4、GPT-3 与 VICUNA,展示了这些复杂视频推理任务中的性能差距,并鼓励未来工作优先采用语言模型以实现高效且通用的视频推理。

关键词

引用

@article{arxiv.2305.13903,
  title  = {Let's Think Frame by Frame with VIP: A Video Infilling and Prediction Dataset for Evaluating Video Chain-of-Thought},
  author = {Vaishnavi Himakunthala and Andy Ouyang and Daniel Rose and Ryan He and Alex Mei and Yujie Lu and Chinmay Sonar and Michael Saxon and William Yang Wang},
  journal= {arXiv preprint arXiv:2305.13903},
  year   = {2023}
}

备注

Accepted to the 2023 Conference on Empirical Methods in Natural Language Processing (EMNLP 2023)