中文

用于视频问答的运动-外观协同记忆网络

计算机视觉与模式识别 2018-03-30 v1

摘要

视频问答(QA)是理解视频时序结构的一项重要任务。我们观察到,与图像问答相比,视频问答具有三个独特属性:(1) 它处理长序列图像,不仅在数量上包含更丰富的信息,在种类上也是如此;(2) 运动与外观信息通常相互关联,并能为对方提供有用的注意力线索;(3) 不同的问题需要不同数量的帧来推断答案。基于这些观察,我们提出了一种用于视频问答的运动-外观协同记忆网络。我们的网络建立在动态记忆网络(DMN)的概念之上,并为视频问答引入了新机制。具体而言,有三个显著方面:(1) 一种利用来自运动和外观的线索以生成注意力的协同记忆注意力机制;(2) 一个用于生成多级上下文事实的时间卷积-反卷积网络;(3) 一种针对不同问题动态构建时间表示的动态事实集成方法。我们在 TGIF-QA 数据集上评估了我们的方法,结果在 TGIF-QA 的所有四个任务上均显著优于现有技术。

关键词

引用

@article{arxiv.1803.10906,
  title  = {Motion-Appearance Co-Memory Networks for Video Question Answering},
  author = {Jiyang Gao and Runzhou Ge and Kan Chen and Ram Nevatia},
  journal= {arXiv preprint arXiv:1803.10906},
  year   = {2018}
}

备注

CVPR 2018