基于知识的视频问答与无监督场景描述
计算机视觉与模式识别
2020-07-20 v1 计算与语言
摘要
为了理解电影,人类不断地对特定场景中的对话和动作进行推理,并将其与已经看到的整体故事情节联系起来。受此行为启发,我们设计了ROLL,一种基于知识的视频故事问答模型,它利用了电影理解的三个关键方面:对话理解、场景推理和故事回忆。在ROLL中,每个任务负责通过1)处理场景对话,2)生成无监督视频场景描述,以及3)以弱监督方式获取外部知识来提取丰富多样的信息。为了正确回答给定问题,每个启发式认知任务生成的信息通过Transformer编码,并通过模态加权机制融合,该机制平衡来自不同来源的信息。详尽的评估证明了我们方法的有效性,在两个具有挑战性的视频问答数据集KnowIT VQA和TVQA+上取得了新的最先进结果。
引用
@article{arxiv.2007.08751,
title = {Knowledge-Based Video Question Answering with Unsupervised Scene Descriptions},
author = {Noa Garcia and Yuta Nakashima},
journal= {arXiv preprint arXiv:2007.08751},
year = {2020}
}