中文

用于零样本视频问答的指令引导视觉描述

计算机视觉与模式识别 2024-07-23 v2

摘要

我们提出了 Q-ViD,这是一种用于视频问答(video QA)的简单方法。与以往基于复杂架构、计算昂贵流程或使用封闭模型(如 GPTs)的方法不同,Q-ViD 依赖单个指令感知的开放视觉 - 语言模型(InstructBLIP),利用帧描述来解决视频 QA 任务。具体而言,我们创建了依赖于视频目标问题的字幕生成指令提示,并利用 InstructBLIP 获取对当前任务有用的视频帧字幕。随后,我们利用这些依赖于问题的帧字幕构建整个视频的描述,并将该信息与问答提示一起输入到大语言模型(LLM)中。LLM 作为我们的推理模块,执行多项选择 QA 的最后一步。我们简单的 Q-ViD 框架在包括 NExT-QA、STAR、How2QA、TVQA 和 IntentQA 在内的多种视频 QA 基准测试中,实现了与当前最先进(SOTA)模型相当甚至更高的性能。

关键词

引用

@article{arxiv.2402.10698,
  title  = {Question-Instructed Visual Descriptions for Zero-Shot Video Question Answering},
  author = {David Romero and Thamar Solorio},
  journal= {arXiv preprint arXiv:2402.10698},
  year   = {2024}
}