中文

视觉问题生成作为视觉问答的对偶任务

计算机视觉与模式识别 2017-09-22 v1

摘要

近年来,视觉问答(VQA)和视觉问题生成(VQG)是计算机视觉中两个分别被探索的热门话题。在这项工作中,我们提出了一个端到端的统一框架,即可逆问答网络(iQAN),通过在VQA和VQG任务上联合训练模型,利用图像中问题与答案之间的互补关系。提出了相应的参数共享方案和正则项作为约束,以明确利用问答依赖关系来指导训练过程。训练后,iQAN可以接受问题或答案作为输入,然后输出对应的另一方。在大规模视觉问答数据集CLEVR和VQA2上进行评估,我们的iQAN相比基线提高了VQA准确率。我们还展示了iQAN的对偶学习框架可以推广到其他VQA架构,并持续改善VQA和VQG任务的结果。

关键词

引用

@article{arxiv.1709.07192,
  title  = {Visual Question Generation as Dual Task of Visual Question Answering},
  author = {Yikang Li and Nan Duan and Bolei Zhou and Xiao Chu and Wanli Ouyang and Xiaogang Wang},
  journal= {arXiv preprint arXiv:1709.07192},
  year   = {2017}
}

备注

9 pages