中文

MMFT-BERT:带有BERT编码的多模态融合Transformer用于视觉问答

计算机视觉与模式识别 2020-10-28 v1

摘要

我们提出MMFT-BERT(带有BERT编码的多模态融合Transformer),以解决视觉问答(VQA)问题,确保对多种输入模态进行独立与联合处理。我们的方法受益于采用BERT编码分别处理多模态数据(视频和文本),并使用一种新颖的基于Transformer的融合方法将它们融合。我们的方法将不同来源的模态分解为具有相似架构但权重可变的不同的BERT实例。这在TVQA数据集上取得了SOTA结果。此外,我们提供了TVQA-Visual,这是TVQA的一个隔离诊断子集,根据人类标注者的判断严格需要视觉(V)模态的知识。这组问题帮助我们研究模型的行为以及TVQA为防止达到超人类性能所带来的挑战。大量实验显示了我们方法的有效性和优越性。

关键词

引用

@article{arxiv.2010.14095,
  title  = {MMFT-BERT: Multimodal Fusion Transformer with BERT Encodings for Visual Question Answering},
  author = {Aisha Urooj Khan and Amir Mazaheri and Niels da Vitoria Lobo and Mubarak Shah},
  journal= {arXiv preprint arXiv:2010.14095},
  year   = {2020}
}

备注

Accepted at Findings of EMNLP 2020