视觉问答最新进展综述
计算机视觉与模式识别
2017-09-26 v1
摘要
视觉问答(Visual Question Answering, VQA)提出了独特的挑战,因为它要求具备理解和编码多模态输入的能力——涉及图像处理与自然语言处理。算法还需进一步学习如何在该多模态表示上进行推理,以便正确回答问题。本文对为解决视觉问答问题而提出的不同方法进行了综述。我们还在论文后半部分描述了当前的最先进模型。具体而言,本文描述了各种算法提取图像特征和文本特征的方法,以及利用这些特征预测答案的方式。我们还简要讨论了为评估 VQA 模型而进行的实验,并报告了它们在包括最新发布的 VQA2.0[8] 在内的多个数据集上的性能。
引用
@article{arxiv.1709.08203,
title = {Survey of Recent Advances in Visual Question Answering},
author = {Supriya Pandhre and Shagun Sodhani},
journal= {arXiv preprint arXiv:1709.08203},
year = {2017}
}
备注
7 pages, 2 tables