中文

上下文中的答案核查:一种用于视觉问答的多模态全注意力网络

计算机视觉与模式识别 2020-10-20 v1 计算与语言

摘要

视觉问答(VQA)由于复杂的跨模态关系而具有挑战性。它已受到研究界的广泛关注。从人类视角来看,要回答一个视觉问题,需要先阅读问题,然后参考图像生成答案。随后该答案将再次对照问题和图像进行核查以做最终确认。在本文中,我们模拟这一过程并提出一种基于全注意力的 VQA 架构。此外,提出一个答案核查模块,对联合的答案、问题和图像表示执行统一注意力以更新答案。这模拟了人类答案核查过程,在上下文中考虑答案。借助答案核查模块和迁移的 BERT 层,我们的模型在 VQA-v2.0 test-standard 划分上以更少的参数取得了 71.57% 的最先进准确率。

关键词

引用

@article{arxiv.2010.08708,
  title  = {Answer-checking in Context: A Multi-modal FullyAttention Network for Visual Question Answering},
  author = {Hantao Huang and Tao Han and Wei Han and Deep Yap and Cheng-Ming Chiang},
  journal= {arXiv preprint arXiv:2010.08708},
  year   = {2020}
}

备注

Accepted in ICPR2020