中文

Visual7W:图像中的定位式问答

计算机视觉与模式识别 2016-04-12 v4 机器学习 神经与进化计算

摘要

我们在物体识别与检测等基本感知任务上取得了巨大进展。然而,由于缺乏更深层次的推理能力,AI模型仍未能在高层次视觉任务上媲美人类。近来,为评估模型的深度图像理解能力,提出了视觉问答(QA)这一新任务。先前工作建立了QA语句与图像之间松散的全局关联。然而实际上,许多问题与答案关联到图像的局部区域。我们通过对象级定位建立文本描述与图像区域之间的语义链接。除先前工作使用的文本答案外,这实现了一种带有视觉答案的新型QA。我们在一个包含大量7W多选QA对的数据集上,于定位设定下研究视觉QA任务。此外,我们在QA任务上评估了人类表现及若干基线模型。最后,我们提出一种带空间注意力的新型LSTM模型来处理7W QA任务。

关键词

引用

@article{arxiv.1511.03416,
  title  = {Visual7W: Grounded Question Answering in Images},
  author = {Yuke Zhu and Oliver Groth and Michael Bernstein and Li Fei-Fei},
  journal= {arXiv preprint arXiv:1511.03416},
  year   = {2016}
}

备注

CVPR 2016