中文

寻找证据:面向文本视觉问答的定位感知答案预测

计算机视觉与模式识别 2020-10-07 v1 计算与语言

摘要

图像中的文本携带了理解场景并进行推理的基本信息。基于文本的视觉问答(text VQA)任务关注需要读取图像中文本的视觉问题。现有的文本 VQA 系统通过从光学字符识别(OCR)文本或固定词表中选取来生成答案。文本的位置信息未被充分利用,且生成的答案缺乏证据。为此,本文提出一种定位感知答案预测网络(LaAP-Net)以应对这一挑战。我们的 LaAP-Net 不仅生成问题的答案,还预测一个边界框作为生成答案的证据。此外,为便于定位任务,提出了一种用于多模态融合的上下文增强 OCR 表示(COR)。在三个文本 VQA 任务的基准数据集上,我们提出的 LaAP-Net 以明显优势优于现有方法。

关键词

引用

@article{arxiv.2010.02582,
  title  = {Finding the Evidence: Localization-aware Answer Prediction for Text Visual Question Answering},
  author = {Wei Han and Hantao Huang and Tao Han},
  journal= {arXiv preprint arXiv:2010.02582},
  year   = {2020}
}

备注

Accepted in COLING2020