中文

面向多模态视频问答的模态偏移注意力网络

计算机视觉与模式识别 2020-07-07 v1

摘要

本文提出一种称为模态偏移注意力网络(MSAN)的模型,用于多模态视频问答(MVQA)任务。MSAN 将该任务分解为两个子任务:(1)定位与问题相关的时间片段,以及(2)基于定位片段准确预测答案。时间定位所需模态可能不同于答案预测所需模态,这种偏移模态的能力对执行该任务至关重要。为此,MSAN 基于(1)时刻提议网络(MPN)——尝试从各模态定位最合适的时间片段,以及(2)异构推理网络(HRN)——利用两模态上的注意力机制预测答案。MSAN 能够通过称为模态重要性调制(MIM)的组件,为每个子任务对两模态赋予重要性权重。实验结果表明,MSAN 在 TVQA 基准数据集上以 71.13% 的测试准确率优于先前最先进水平。我们进行了充分的消融研究与定性分析以验证网络的各组件。

关键词

引用

@article{arxiv.2007.02036,
  title  = {Modality Shifting Attention Network for Multi-modal Video Question Answering},
  author = {Junyeong Kim and Minuk Ma and Trung Pham and Kyungsu Kim and Chang D. Yoo},
  journal= {arXiv preprint arXiv:2007.02036},
  year   = {2020}
}

备注

CVPR2020 accepted; poster