MCQA:基于多模态协同注意力的问答网络
计算与语言
2020-04-28 v1
摘要
我们提出MCQA,一种基于学习的多模态问答算法。MCQA显式地融合与对齐多模态输入(即文本、音频和视频),其构成查询(问题与答案)的上下文。我们的方法在该上下文中融合并对齐问题与答案。此外,我们利用协同注意力(co-attention)的概念来执行跨模态对齐与多模态上下文-查询对齐。我们的上下文-查询对齐模块将多模态上下文与查询的相关部分相互匹配并对齐,以提升整体性能。我们在多模态问答基准数据集Social-IQ上评估MCQA的性能。我们将算法性能与先前方法比较,观察到准确率提升4–7%。
引用
@article{arxiv.2004.12238,
title = {MCQA: Multimodal Co-attention Based Network for Question Answering},
author = {Abhishek Kumar and Trisha Mittal and Dinesh Manocha},
journal= {arXiv preprint arXiv:2004.12238},
year = {2020}
}