中文

学习在自然图像中计数物体以用于视觉问答

计算机视觉与模式识别 2018-02-19 v1 计算与语言

摘要

视觉问答(VQA)模型迄今为止在计数自然图像中的物体方面表现不佳。我们将软注意力在这些模型中导致的一个根本问题认定为原因。为规避该问题,我们提出了一个神经网络组件,可从物体提议中实现稳健计数。在一个玩具任务上的实验显示了该组件的有效性,并且我们在 VQA v2 数据集的数量类别上取得了当前最佳准确率,且未对其他类别产生负面影响,甚至以单一模型超越了集成模型。在一个困难的平衡配对度量上,该组件相比强基线在计数方面给出了 6.6% 的实质性改进。

关键词

引用

@article{arxiv.1802.05766,
  title  = {Learning to Count Objects in Natural Images for Visual Question Answering},
  author = {Yan Zhang and Jonathon Hare and Adam Prügel-Bennett},
  journal= {arXiv preprint arXiv:1802.05766},
  year   = {2018}
}

备注

Published in ICLR 2018