用于电影问答的对抗多模态网络
计算机视觉与模式识别
2020-03-13 v2
摘要
近年来,利用多模态信息进行视觉问答吸引了越来越多的关注。然而,这是一项极具挑战性的任务,因为视觉内容和自然语言具有截然不同的统计特性。在这项工作中,我们提出了一种称为对抗多模态网络(Adversarial Multimodal Network, AMN)的方法,以更好地理解视频故事用于问答。在 AMN 中,受生成对抗网络启发,我们提出通过为视频片段与对应文本(例如字幕和问题)寻找更具一致性的子空间来学习多模态特征表示。此外,我们引入自注意力机制以强制所谓的一致性约束,从而在学到的多模态表示中保留原始视频片段视觉线索的自相关性。在 MovieQA 数据集上的大量实验表明,我们提出的 AMN 优于其他已发表的最先进方法。
引用
@article{arxiv.1906.09844,
title = {Adversarial Multimodal Network for Movie Question Answering},
author = {Zhaoquan Yuan and Siyuan Sun and Lixin Duan and Xiao Wu and Changsheng Xu},
journal= {arXiv preprint arXiv:1906.09844},
year = {2020}
}
备注
We will revise the paper