上下文中的答案核查:一种用于视觉问答的多模态全注意力网络
计算机视觉与模式识别
2020-10-20 v1 计算与语言
摘要
视觉问答(VQA)由于复杂的跨模态关系而具有挑战性。它已受到研究界的广泛关注。从人类视角来看,要回答一个视觉问题,需要先阅读问题,然后参考图像生成答案。随后该答案将再次对照问题和图像进行核查以做最终确认。在本文中,我们模拟这一过程并提出一种基于全注意力的 VQA 架构。此外,提出一个答案核查模块,对联合的答案、问题和图像表示执行统一注意力以更新答案。这模拟了人类答案核查过程,在上下文中考虑答案。借助答案核查模块和迁移的 BERT 层,我们的模型在 VQA-v2.0 test-standard 划分上以更少的参数取得了 71.57% 的最先进准确率。
引用
@article{arxiv.2010.08708,
title = {Answer-checking in Context: A Multi-modal FullyAttention Network for Visual Question Answering},
author = {Hantao Huang and Tao Han and Wei Han and Deep Yap and Cheng-Ming Chiang},
journal= {arXiv preprint arXiv:2010.08708},
year = {2020}
}
备注
Accepted in ICPR2020