用于视觉问题生成的模态差分网络
计算与语言
2019-10-18 v2 人工智能
计算机视觉与模式识别
摘要
从图像生成自然问题是一项语义任务,需要使用视觉与语言模态学习多模态表示。图像可具有多个与生成问题相关的视觉与语言上下文,即场景、图像描述与标签。本文提出利用示例来获取相关上下文,通过多模态差分网络(Multimodal Differential Network)生成自然且引人入胜的问题。如人工研究所验证,生成的问题与自然问题表现出显著相似性。此外,我们观察到所提方法在量化指标(BLEU、METEOR、ROUGE 和 CIDEr)上大幅优于当前最优基准。
引用
@article{arxiv.1808.03986,
title = {Multimodal Differential Network for Visual Question Generation},
author = {Badri N. Patro and Sandeep Kumar and Vinod K. Kurmi and Vinay P. Namboodiri},
journal= {arXiv preprint arXiv:1808.03986},
year = {2019}
}
备注
EMNLP 2018 (accepted)