中文

用于视觉问题生成的深度贝叶斯网络

计算机视觉与模式识别 2020-01-27 v1 人工智能 计算与语言 机器学习 多媒体

摘要

从图像生成自然语言问题是一项语义任务,需要使用视觉与语言模态来学习多模态表示。图像可具有多种视觉与语言线索,如场景、描述文本和标签。在本文中,我们提出了一个原理性的深度贝叶斯学习框架,将这些线索结合以生成自然语言问题。我们观察到,随着更多线索的加入并最小化线索间的不确定性,贝叶斯网络变得更加置信。我们提出了最小化线索混合不确定性(MUMC),该方法最小化用于生成概率性问题的线索混合专家中存在的不确定性。这是一个贝叶斯框架,结果显示其生成的问题与自然问题高度相似,并通过人类研究得到验证。我们观察到,随着更多线索的加入并最小化线索间的不确定性,该贝叶斯框架变得更加置信。我们模型的消融研究表明,线索的子集在此任务上表现较差,因此更倾向于原理性的线索融合。此外,我们观察到所提方法在定量指标(BLEU-n、METEOR、ROUGE 和 CIDEr)上显著优于 SOTA 基准。此处提供 Deep Bayesian VQG 项目链接 \url{https://delta-lab-iitk.github.io/BVQG/}

关键词

引用

@article{arxiv.2001.08779,
  title  = {Deep Bayesian Network for Visual Question Generation},
  author = {Badri N. Patro and Vinod K. Kurmi and Sandeep Kumar and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:2001.08779},
  year   = {2020}
}

备注

WACV-2020 (Accepted)