中文

弱监督视觉问答生成

计算机视觉与模式识别 2023-09-12 v2

摘要

对对话智能体日益增长的兴趣推动了涉及提问与回答视觉问题的双向人机通信,已成为人工智能中的活跃研究领域。因此,视觉问答对的生成成为一项重要且富有挑战性的任务。为解决此问题,我们提出一种弱监督视觉问答生成方法,为给定输入图像及关联字幕生成相关的问答对。大多数先前工作为有监督并依赖于标注的问答数据集。在我们的工作中,我们提出一种弱监督方法,从视觉信息和字幕中程序化地合成生成问答对。所提方法首先提取答案词列表,然后进行最近邻问题生成,利用字幕和答案词生成合成问题。接下来,相关问题生成器通过依存分析和有序树遍历将最近邻问题转换为相关语言问题,最后用生成的问答对微调ViLBERT模型。我们在VQA数据集上进行了详尽的实验分析,发现我们的模型在BLEU分数上显著优于SOTA方法。我们还展示了相对于基线模型和消融研究的结果。

关键词

引用

@article{arxiv.2306.06622,
  title  = {Weakly Supervised Visual Question Answer Generation},
  author = {Charani Alampalle and Shamanthak Hegde and Soumya Jahagirdar and Shankar Gangisetty},
  journal= {arXiv preprint arXiv:2306.06622},
  year   = {2023}
}