中文

面向视频问答的位置感知图卷积网络

计算机视觉与模式识别 2020-08-21 v1 计算与语言

摘要

我们解决了视频问答这一具有挑战性的任务,该任务要求机器以自然语言形式回答关于视频的问题。先前的最先进方法试图在视频帧特征上应用时空注意力机制,而未显式建模视频中物体交互发生的位置与关系。然而,物体交互与其位置信息之间的关系对于动作识别和问题推理都极为关键。在本工作中,我们提出通过将物体的位置信息纳入图构建过程,将视频内容表示为位置感知图。此处,每个节点关联一个由外观与位置特征表示的物体。基于所构建的图,我们提出使用图卷积来推断动作的类别与时间位置。由于图构建于物体之上,我们的方法能够聚焦于前景动作内容,从而实现更好的视频问答。最后,我们利用注意力机制结合图卷积的输出与编码后的问题特征进行最终答案推理。大量实验证明了所提方法的有效性。具体而言,我们的方法在 TGIF-QA、Youtube2Text-QA 和 MSVD-QA 数据集上显著优于最先进方法。代码与预训练模型公开于:https://github.com/SunDoge/L-GCN

关键词

引用

@article{arxiv.2008.09105,
  title  = {Location-aware Graph Convolutional Networks for Video Question Answering},
  author = {Deng Huang and Peihao Chen and Runhao Zeng and Qing Du and Mingkui Tan and Chuang Gan},
  journal= {arXiv preprint arXiv:2008.09105},
  year   = {2020}
}