中文

视频中基于知识的视觉问答

计算机视觉与模式识别 2020-04-21 v1 计算与语言

摘要

我们通过融合基于知识的问答与视频问答,提出了一项新颖的视频理解任务。首先,我们引入了 KnowIT VQA,这是一个包含 24,282 个人工生成的关于一部流行情景喜剧的问答对的视频数据集。该数据集将视觉、文本和时间连贯性推理与基于知识的问题相结合,这些问题需要从观看该剧集所获得的经验才能回答。其次,我们通过将视觉和文本视频内容与关于该剧集的特定知识相结合,提出了一个视频理解模型。我们的主要发现是:(i) 知识的引入为视频中的视觉问答带来了显著的性能提升,以及 (ii) 在 KnowIT VQA 上的表现仍远落后于人类准确率,这表明了其对于研究当前视频建模局限性的有用性。

关键词

引用

@article{arxiv.2004.08385,
  title  = {Knowledge-Based Visual Question Answering in Videos},
  author = {Noa Garcia and Mayu Otani and Chenhui Chu and Yuta Nakashima},
  journal= {arXiv preprint arXiv:2004.08385},
  year   = {2020}
}

备注

arXiv admin note: substantial text overlap with arXiv:1910.10706