中文

面向新颖物体的视觉问答的实证评估

计算机视觉与模式识别 2017-04-11 v1

摘要

我们研究在更困难的设定下回答关于图像的问题,其中测试问题及相应图像包含新颖物体,这些物体在训练数据中未被查询过。由于视觉类别的长尾分布,这种设定在现实世界中不可避免,会有一些物体未在训练集中标注。我们表明,两种流行的现有方法在新颖物体上与已知物体相比性能下降显著(高达28%)。我们提出使用大型现有外部语料库的方法:(i)无标签文本(即书籍),以及(ii)带有类别标签的图像,以实现基于新颖物体的视觉问答。我们进行了系统的实证研究,既包括新颖物体文本已知的预言机情形,也包括没有任何新颖物体显式知识但假设新颖物体与训练中的现有物体语义相关的最小假设下的全自动情形。所提出的基于新颖物体的视觉问答方法是模块化的,并有可能与许多视觉问答架构一起使用。我们在两种流行架构上展示了持续的改进,并对模型表现良好以及未能带来改进的情况进行了定性分析。

关键词

引用

@article{arxiv.1704.02516,
  title  = {An Empirical Evaluation of Visual Question Answering for Novel Objects},
  author = {Santhosh K. Ramakrishnan and Ambar Pal and Gaurav Sharma and Anurag Mittal},
  journal= {arXiv preprint arXiv:1704.02516},
  year   = {2017}
}

备注

11 pages, 4 figures, accepted in CVPR 2017 (poster)