中文

基于属性增强注意力网络学习的视频问答

计算机视觉与模式识别 2017-07-21 v1 人工智能 计算与语言

摘要

视频问答是视觉信息检索中的一个具有挑战性的问题,它根据问题对所引用的视频内容提供答案。然而,现有的视觉问答方法主要处理静态图像问题,由于对视频内容时间动态的建模不足,这些方法可能对视频问答无效。在本文中,我们通过帧级注意力机制对时间动态进行建模来研究视频问答问题。我们提出了属性增强注意力网络学习框架,该框架能够进行联合帧级属性检测和统一的视频表示学习以用于视频问答。然后,我们将多步推理过程纳入我们提出的注意力网络以进一步提升性能。我们构建了一个大规模视频问答数据集。我们在多选和开放式视频问答任务上进行了实验,以展示所提方法的有效性。

关键词

引用

@article{arxiv.1707.06355,
  title  = {Video Question Answering via Attribute-Augmented Attention Network Learning},
  author = {Yunan Ye and Zhou Zhao and Yimeng Li and Long Chen and Jun Xiao and Yueting Zhuang},
  journal= {arXiv preprint arXiv:1707.06355},
  year   = {2017}
}

备注

Accepted for SIGIR 2017