双重提示提问:具有答案感知和区域参考的视觉问题生成
计算机视觉与模式识别
2024-07-09 v1 计算与语言
多媒体
摘要
视觉问题生成(VQG)任务旨在从图像和潜在的其他辅助信息(例如答案类型)中生成类人问题。以往关于VQG的研究存在两个方面的问题:i) 它们面临一张图像对应多个问题的映射问题,导致无法从图像中生成具有指代性和有意义的问题。ii) 它们未能对图像中视觉对象之间复杂的隐含关系进行建模,并且忽略了辅助信息与图像之间的潜在交互。为了解决这些局限性,我们首先提出了一种新颖的学习范式,用于生成具有答案感知和区域参考的视觉问题。具体而言,我们旨在利用双重提示——文本答案和视觉感兴趣区域——来提出正确的视觉问题,这可以有效缓解现有的一对多映射问题。特别地,我们开发了一种简单的方法来自我学习视觉提示,无需引入任何额外的人工标注。此外,为了捕捉这些复杂的关系,我们提出了一种新的双重提示引导的图到序列学习框架,该框架首先将其建模为动态图并端到端地学习隐含拓扑,然后利用图到序列模型生成带有双重提示的问题。实验结果证明了我们提出的方法的优越性。
引用
@article{arxiv.2407.05100,
title = {Ask Questions with Double Hints: Visual Question Generation with Answer-awareness and Region-reference},
author = {Kai Shen and Lingfei Wu and Siliang Tang and Fangli Xu and Bo Long and Yueting Zhuang and Jian Pei},
journal= {arXiv preprint arXiv:2407.05100},
year = {2024}
}