中文

用于电影问答的对抗多模态网络

计算机视觉与模式识别 2020-03-13 v2

摘要

近年来,利用多模态信息进行视觉问答吸引了越来越多的关注。然而,这是一项极具挑战性的任务,因为视觉内容和自然语言具有截然不同的统计特性。在这项工作中,我们提出了一种称为对抗多模态网络(Adversarial Multimodal Network, AMN)的方法,以更好地理解视频故事用于问答。在 AMN 中,受生成对抗网络启发,我们提出通过为视频片段与对应文本(例如字幕和问题)寻找更具一致性的子空间来学习多模态特征表示。此外,我们引入自注意力机制以强制所谓的一致性约束,从而在学到的多模态表示中保留原始视频片段视觉线索的自相关性。在 MovieQA 数据集上的大量实验表明,我们提出的 AMN 优于其他已发表的最先进方法。

关键词

引用

@article{arxiv.1906.09844,
  title  = {Adversarial Multimodal Network for Movie Question Answering},
  author = {Zhaoquan Yuan and Siyuan Sun and Lixin Duan and Xiao Wu and Changsheng Xu},
  journal= {arXiv preprint arXiv:1906.09844},
  year   = {2020}
}

备注

We will revise the paper