中文

用于视觉问答与视觉问句生成的深度范例网络

计算机视觉与模式识别 2019-12-23 v1 人工智能 计算与语言 机器学习

摘要

本文中,我们考虑解决诸如“视觉问答”(VQA,旨在回答与图像相关的问题)和“视觉问句生成”(VQG,旨在生成与图像相关的自然语言问句)等语义任务的问题。已有研究使用基于编码器-解码器深度学习框架的变体来解决VQA和VQG任务,并展现出令人印象深刻的性能。然而,人类常通过依赖基于范例的方法表现出泛化能力。例如,Tversky和Kahneman的工作表明,人类在进行分类和决策时会使用范例。本工作中,我们提出将基于范例的方法引入以解决这些问题。具体而言,我们融入基于范例的方法,并表明基于范例的模块可嵌入文献中提出的几乎所有深度学习架构中,且加入此类模块可提升解决这些任务的性能。因此,正如注意力机制的引入现被视为解决这些任务的默认有用组件,类似地,融入范例也可被视为能改进任何用于该任务的已有架构。我们通过多种架构、消融实验和当前最优(SOTA)对比提供了详尽的实证分析。

关键词

引用

@article{arxiv.1912.09551,
  title  = {Deep Exemplar Networks for VQA and VQG},
  author = {Badri N. Patro and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:1912.09551},
  year   = {2019}
}

备注

This work is an extension of CVPR-2018 accepted paper arXiv:1804.00298 and EMNLP-2018 accepted paper arXiv:1808.03986