中文

零样本视觉问答

计算机视觉与模式识别 2016-11-22 v2 人工智能 计算与语言

摘要

视觉问答(VQA)的部分吸引力在于其承诺能回答关于先前未见图像的新问题。当前大多数方法要求训练问题涵盖所有可能的概念,因此永远无法实现这一能力,因为所需的训练数据量将是难以承受的。回答关于图像的一般性问题需要具备零样本 VQA 能力的方法,即能够回答超出训练问题范围的问题的方法。我们为 VQA 方法提出了一个新的评估协议,用于衡量其执行零样本 VQA 的能力,并由此凸显了当前方法在实践中的显著缺陷,其中一些缺陷被当前数据集中的偏差所掩盖。我们提出并评估了几种实现零样本 VQA 的策略,包括基于预训练词嵌入的方法、带有语义嵌入的物体分类器,以及测试时示例图像检索。我们广泛的实验旨在作为零样本 VQA 的基线,并且这些方法在标准 VQA 评估设置中也达到了最先进的性能。

关键词

引用

@article{arxiv.1611.05546,
  title  = {Zero-Shot Visual Question Answering},
  author = {Damien Teney and Anton van den Hengel},
  journal= {arXiv preprint arXiv:1611.05546},
  year   = {2016}
}