用于视频故事问答的多模态双注意力记忆
计算机视觉与模式识别
2018-09-24 v1 人工智能
计算与语言
多媒体
摘要
我们提出了一种视频故事问答(QA)架构——多模态双注意力记忆(MDAM)。其核心思想是使用具有后期融合的双注意力机制。MDAM 利用自注意力学习场景帧与字幕中的潜在概念。给定一个问题,MDAM 对这些潜在概念使用第二重注意力。多模态融合在双注意力处理之后进行(后期融合)。通过该处理流程,MDAM 学会从完整视频内容的抽象中推断出一个高层视觉-语言联合表示。我们在 PororoQA 和 MovieQA 数据集上评估 MDAM,这两个数据集分别包含卡通视频和电影的大规模 QA 标注。在这两个数据集上,MDAM 均取得了新的最先进(state-of-the-art)结果,相较于亚军模型具有显著优势。我们通过消融实验确认了双注意力机制结合后期融合的最佳性能。我们还通过可视化 MDAM 的推理机制进行了定性分析。
引用
@article{arxiv.1809.07999,
title = {Multimodal Dual Attention Memory for Video Story Question Answering},
author = {Kyung-Min Kim and Seong-Ho Choi and Jin-Hwa Kim and Byoung-Tak Zhang},
journal= {arXiv preprint arXiv:1809.07999},
year = {2018}
}
备注
Accepted for ECCV 2018