KnowIT VQA:关于视频的知识型问答
计算机视觉与模式识别
2019-12-25 v3 计算与语言
摘要
我们通过融合基于知识的问答与视频问答,提出了一种新颖的视频理解任务。首先,我们引入 KnowIT VQA,一个包含关于某热门情景喜剧的 24,282 个人工生成问答对的视频数据集。该数据集将视觉、文本与 temporal coherence 推理与基于知识的问题相结合,后者需通过观看该系列剧集获得的经验来回答。其次,我们提出一种通过将视频视觉与文本内容与该剧特定知识相结合的视频理解模型。我们的主要发现是:(i)知识的引入为视频中的 VQA 带来显著提升;(ii)KnowIT VQA 上的性能仍远落后于人类准确率,表明其对于研究当前视频建模局限性具有效用。
引用
@article{arxiv.1910.10706,
title = {KnowIT VQA: Answering Knowledge-Based Questions about Videos},
author = {Noa Garcia and Mayu Otani and Chenhui Chu and Yuta Nakashima},
journal= {arXiv preprint arXiv:1910.10706},
year = {2019}
}