中文

通过参考生成的段落式图像描述改进视觉问答

计算与语言 2019-06-17 v1

摘要

段落式图像描述刻画了图像的不同方面,不同于更常见的仅提供图像抽象描述的单句描述。这些段落描述因而可包含图像的大量信息,用于视觉问答等任务。此外,该文本信息与图像中存在的视觉信息互补,因为它既能讨论更抽象的概念,也能讨论关于物体、事件和场景的更明确的中间符号信息,这些信息可直接与文本问题匹配并复制到文本答案中(即通过更简便的模态匹配)。因此,我们提出一种联合视觉与文本问答(VTQA)模型,该模型以段落描述和相应图像为输入,并基于两种输入回答问题。在我们的模型中,输入通过交叉注意力融合以提取相关信息(早期融合),再以共识形式融合(晚期融合),最后对期望答案给予额外打分以提升被选中几率(更晚融合)。实证结果表明,即便段落描述是自动生成的(通过基于强化学习的编码器-解码器模型),也有助于正确回答更多视觉问题。总体而言,我们的联合模型在 Visual Genome 数据集上训练时,相较强基线模型显著提升了 VQA 性能。

关键词

引用

@article{arxiv.1906.06216,
  title  = {Improving Visual Question Answering by Referring to Generated Paragraph Captions},
  author = {Hyounghun Kim and Mohit Bansal},
  journal= {arXiv preprint arXiv:1906.06216},
  year   = {2019}
}

备注

ACL 2019 (7 pages)