基于图像的视觉问题自动生成
计算机视觉与模式识别
2017-05-30 v2 计算与语言
摘要
本文提出了首个能够为单张图像生成多种类型且基于视觉内容的问题的模型。视觉问题生成是一个新兴课题,旨在基于视觉输入用自然语言提出问题。据我们所知,目前缺乏自动方法为同一视觉输入生成具有多种类型的有意义问题。为解决这一问题,我们提出了一种模型,能够自动生成类型多样的基于视觉内容的问题。该模型以图像和密集描述模型生成的描述作为输入,采样最可能的问题类型,然后依次生成问题。在两个真实世界数据集上的实验结果表明,我们的模型在正确性和多样性方面均以较大幅度超越了最强基线。
引用
@article{arxiv.1612.06530,
title = {Automatic Generation of Grounded Visual Questions},
author = {Shijie Zhang and Lizhen Qu and Shaodi You and Zhenglu Yang and Jiawan Zhang},
journal= {arXiv preprint arXiv:1612.06530},
year = {2017}
}
备注
VQA