联合图像描述与视觉问答
计算与语言
2018-05-23 v1 计算机视觉与模式识别
摘要
回答视觉问题需要获取日常常识并建模图像中不同部分之间的语义联系,这对于仅以答案为监督的 VQA 系统而言从图像中学习过于困难。同时,采用束搜索策略的图像描述系统倾向于生成相似的描述,无法多样地描述图像。为解决上述问题,我们提出一个使这两个任务相互补偿的系统,能够联合生成图像描述与回答视觉问题。具体而言,我们利用问题与图像特征生成与问题相关的描述,并将生成的描述作为额外特征为 VQA 系统提供新知识。对于图像描述,我们的系统在 VQA 任务相对提升方面获得了更具信息量的结果,同时使用自动指标也取得了有竞争力的结果。将我们的系统应用于 VQA 任务,在 VQA v2 数据集上,使用生成描述在验证集取得 65.8%、使用标注描述取得 69.1%,在 test-standard 集取得 68.4%。此外,10 个模型的集成在 test-standard 划分上达到 69.7%。
引用
@article{arxiv.1805.08389,
title = {Joint Image Captioning and Question Answering},
author = {Jialin Wu and Zeyuan Hu and Raymond J. Mooney},
journal= {arXiv preprint arXiv:1805.08389},
year = {2018}
}