中文

利用问题类型先验知识进行多交互学习以约束视觉问答中的答案搜索空间

计算机视觉与模式识别 2020-09-24 v1

摘要

已有多种方法被提出用于视觉问答(VQA)。然而,很少有工作关注不同联合模态方法在从数据中提取的问题类型先验知识方面约束答案搜索空间的行为,而该信息为推理输入图像中所提问题的答案提供了可靠线索。本文提出一种新颖的VQA模型,该模型利用问题类型先验信息,基于不同联合模态方法在回答不同类型问题时的行为之间的多重交互来改进VQA。在两个基准数据集(即VQA 2.0和TDIUC)上的扎实实验表明,所提方法与最具竞争力的方案相比取得了最佳性能。

关键词

引用

@article{arxiv.2009.11118,
  title  = {Multiple interaction learning with question-type prior knowledge for constraining answer search space in visual question answering},
  author = {Tuong Do and Binh X. Nguyen and Huy Tran and Erman Tjiputra and Quang D. Tran and Thanh-Toan Do},
  journal= {arXiv preprint arXiv:2009.11118},
  year   = {2020}
}

备注

Accepted in ECCV Workshop 2020