利用视觉问答进行图像-描述排序
计算机视觉与模式识别
2016-09-02 v2
摘要
视觉问答(VQA)的任务是输入一幅图像和关于该图像的自由形式自然语言问题,并给出准确答案。在这项工作中,我们将VQA视为一个“特征提取”模块来提取图像和描述表示。我们利用这些表示用于图像-描述排序任务。每个特征维度捕捉(设想)某个事实(问答对)是否可能对该图像和描述成立。这使得模型能够从多种视角解释图像和描述。我们提出了分数级和表示级融合模型,将VQA知识整合到现有的最先进的与VQA无关的(VQA-agnostic)图像-描述排序模型中。我们发现,整合并对图像与描述之间的一致性进行推理可显著提升性能。具体而言,我们的模型在MSCOCO数据集上将描述检索的最先进水平提高了7.1%,将图像检索提高了4.4%。
引用
@article{arxiv.1605.01379,
title = {Leveraging Visual Question Answering for Image-Caption Ranking},
author = {Xiao Lin and Devi Parikh},
journal= {arXiv preprint arXiv:1605.01379},
year = {2016}
}