生成与问题相关的图像描述以辅助视觉问答
计算机视觉与模式识别
2020-01-07 v3 计算与语言
摘要
视觉问答(VQA)与图像描述需要一个连接语言与视觉的通用知识共享体。我们提出一种新颖方法以提升 VQA 性能,其通过联合生成针对帮助回答特定视觉问题而定向的图像描述来利用这一联系。该模型使用现有描述数据集训练,通过基于在线梯度的方法自动确定与问题相关的描述。在 VQA v2 challenge 上的实验结果表明,我们的方法通过同时生成与问题相关的描述,获得了最先进的 VQA 性能(例如,使用单一模型在 Test-standard 集上达到 68.4%)。
引用
@article{arxiv.1906.00513,
title = {Generating Question Relevant Captions to Aid Visual Question Answering},
author = {Jialin Wu and Zeyuan Hu and Raymond J. Mooney},
journal= {arXiv preprint arXiv:1906.00513},
year = {2020}
}
备注
ACL 2019 camera-ready