引导式视觉问题生成
机器学习
2022-07-27 v3 计算与语言
计算机视觉与模式识别
摘要
在传统的视觉问题生成(VQG)中,大多数图像具有多个可生成问题的概念(如物体与类别),但模型被训练为模仿其训练数据中给定的任意概念选择。这使得训练困难,并且也给评估带来问题——大多数图像存在多个有效问题,但仅有人类参考中的一个或少数几个被捕获。我们提出引导式视觉问题生成(Guiding Visual Question Generation)——VQG 的一种变体,它基于对所探讨问题类型及物体的预期,以类别信息条件化问题生成器。我们提出两种变体:(i) 显式引导模型,使参与者(人类或自动化)能够选择要为哪些物体和类别生成问题;(ii) 隐式引导模型,基于离散潜变量学习应以哪些物体和类别为条件。所提模型在一个答案类别增强的 VQA 数据集上评估,我们的定量结果显示相较当前最优水平有显著提升(BLEU-4 提升超过 9 分)。人工评估证实引导有助于生成语法连贯且与给定图像及物体相关的问题。
引用
@article{arxiv.2110.08226,
title = {Guiding Visual Question Generation},
author = {Nihir Vedd and Zixu Wang and Marek Rei and Yishu Miao and Lucia Specia},
journal= {arXiv preprint arXiv:2110.08226},
year = {2022}
}
备注
14 pages including references and Appendix. 3 figures and 4 tables