VQA-Machine:学习如何使用现有视觉算法回答新问题
计算机视觉与模式识别
2016-12-19 v1
摘要
视觉问答(VQA)挑战最引人入胜的特征之一是问题的不可预测性。提取回答它们所需的信息需要多种图像操作,从检测和计数到分割和重建。仅从{图像,问题,答案}元组中训练一种方法准确地执行哪怕其中一种操作都是具有挑战性的,而旨在用有限的此类训练数据实现所有这些操作,往好了说也是极具野心的。相反,我们在此提出了一种更通用且可扩展的方法,该方法利用了一个事实,即实现这些操作的非常好的方法已经存在,因此不需要被训练。因此,我们的方法学习如何利用一组外部的现成算法来实现其目标,这种方法与神经图灵机有某些共同之处。我们提出方法的核心是一个新的协同注意力模型。此外,所提出的方法为其决策生成人类可读的理由,并且仍然可以在没有给出真实理由的情况下进行端到端训练。我们在两个公开可用的数据集Visual Genome和VQA上证明了其有效性,并表明它在两种情况下都产生了最先进的结果。
引用
@article{arxiv.1612.05386,
title = {The VQA-Machine: Learning How to Use Existing Vision Algorithms to Answer New Questions},
author = {Peng Wang and Qi Wu and Chunhua Shen and Anton van den Hengel},
journal= {arXiv preprint arXiv:1612.05386},
year = {2016}
}