视觉问题生成作为视觉问答的对偶任务
计算机视觉与模式识别
2017-09-22 v1
摘要
近年来,视觉问答(VQA)和视觉问题生成(VQG)是计算机视觉中两个分别被探索的热门话题。在这项工作中,我们提出了一个端到端的统一框架,即可逆问答网络(iQAN),通过在VQA和VQG任务上联合训练模型,利用图像中问题与答案之间的互补关系。提出了相应的参数共享方案和正则项作为约束,以明确利用问答依赖关系来指导训练过程。训练后,iQAN可以接受问题或答案作为输入,然后输出对应的另一方。在大规模视觉问答数据集CLEVR和VQA2上进行评估,我们的iQAN相比基线提高了VQA准确率。我们还展示了iQAN的对偶学习框架可以推广到其他VQA架构,并持续改善VQA和VQG任务的结果。
引用
@article{arxiv.1709.07192,
title = {Visual Question Generation as Dual Task of Visual Question Answering},
author = {Yikang Li and Nan Duan and Bolei Zhou and Xiao Chu and Wanli Ouyang and Xiaogang Wang},
journal= {arXiv preprint arXiv:1709.07192},
year = {2017}
}
备注
9 pages