零样本视觉问答
计算机视觉与模式识别
2016-11-22 v2 人工智能
计算与语言
摘要
视觉问答(VQA)的部分吸引力在于其承诺能回答关于先前未见图像的新问题。当前大多数方法要求训练问题涵盖所有可能的概念,因此永远无法实现这一能力,因为所需的训练数据量将是难以承受的。回答关于图像的一般性问题需要具备零样本 VQA 能力的方法,即能够回答超出训练问题范围的问题的方法。我们为 VQA 方法提出了一个新的评估协议,用于衡量其执行零样本 VQA 的能力,并由此凸显了当前方法在实践中的显著缺陷,其中一些缺陷被当前数据集中的偏差所掩盖。我们提出并评估了几种实现零样本 VQA 的策略,包括基于预训练词嵌入的方法、带有语义嵌入的物体分类器,以及测试时示例图像检索。我们广泛的实验旨在作为零样本 VQA 的基线,并且这些方法在标准 VQA 评估设置中也达到了最先进的性能。
引用
@article{arxiv.1611.05546,
title = {Zero-Shot Visual Question Answering},
author = {Damien Teney and Anton van den Hengel},
journal= {arXiv preprint arXiv:1611.05546},
year = {2016}
}