阴阳:二值视觉问答的平衡与回答
计算与语言
2016-04-20 v5 计算机视觉与模式识别
机器学习
摘要
语言的复杂组合结构使得视觉与语言交叉的问题具有挑战性。但语言也提供了强大的先验,可在底层模型并未真正理解视觉内容的情况下取得良好的表面性能。这会阻碍在多模态 AI 的计算机视觉方面推进最先进水平的进展。本文处理抽象场景上的二值视觉问答 (VQA)。我们将此问题表述为问题中询问概念在视觉上的验证。具体地,我们将问题转换为一个元组,该元组简要总结了要在图像中检测的视觉概念。如果在图像中找到该概念,则问题答案为“是”,否则为“否”。抽象场景起两个作用:(1) 它们使我们聚焦于 VQA 任务的高层语义而非底层识别问题,且或许更重要,(2) 它们为我们提供了平衡数据集的模态,从而语言先验受控,且视觉的作用至关重要。特别地,我们为每个问题收集精细配对的场景,使得对同一问题,一个场景的答案为“是”,另一个为“否”。确实,在我们的平衡数据集上仅依靠语言先验的表现不比随机猜测更好。此外,我们提出的方法在非平衡数据集上匹配了最先进 VQA 方法的性能,并在平衡数据集上超越了该性能。
引用
@article{arxiv.1511.05099,
title = {Yin and Yang: Balancing and Answering Binary Visual Questions},
author = {Peng Zhang and Yash Goyal and Douglas Summers-Stay and Dhruv Batra and Devi Parikh},
journal= {arXiv preprint arXiv:1511.05099},
year = {2016}
}