用于电影问答的整体多模态记忆网络
计算机视觉与模式识别
2018-11-13 v1
摘要
根据多模态上下文回答问题是一项具有挑战性的问题,因为它要求对不同数据源进行深度整合。现有方法仅在一次注意力跳中利用数据源之间的部分交互。在本文中,我们提出整体多模态记忆网络(HMMN)框架,该框架在每一跳中充分考虑不同输入源(多模态上下文、问题)之间的交互。此外,它在上下文检索阶段将答案选项纳入考虑。因此,所提框架有效地整合了多模态上下文、问题与答案信息,从而为问答检索到信息更丰富的上下文。我们的 HMMN 框架在 MovieQA 数据集上取得了最先进的准确率。广泛的消融实验显示了整体推理的重要性以及不同注意力策略的贡献。
引用
@article{arxiv.1811.04595,
title = {Holistic Multi-modal Memory Network for Movie Question Answering},
author = {Anran Wang and Anh Tuan Luu and Chuan-Sheng Foo and Hongyuan Zhu and Yi Tay and Vijay Chandrasekhar},
journal= {arXiv preprint arXiv:1811.04595},
year = {2018}
}