中文

展示、询问、注意力与回答:视觉问答的一个强基线

计算机视觉与模式识别 2017-04-13 v2

摘要

本文提出了一种用于视觉问答任务的新基线。给定一幅图像和一个自然语言问题,我们的模型根据图像内容生成准确的答案。我们的模型在架构上简单且可训练参数相对较少,却在非平衡和平衡 VQA 基准上都设定了新的 state of the art。在 VQA 1.0 开放式挑战中,我们的模型在不使用额外数据的情况下在 test-standard 集上达到了 64.6% 的准确率,比 state of the art 提高了 0.4%;在新发布的 VQA 2.0 上,我们的模型在验证集上取得了 59.7% 的分数,比先前报道的最佳结果高出 0.5%。本文呈现的结果尤其有趣,因为之前已尝试过非常相似的模型但报告的性能明显更低。鉴于这些新结果,我们希望未来能看到更多关于视觉问答的有意义研究。

关键词

引用

@article{arxiv.1704.03162,
  title  = {Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering},
  author = {Vahid Kazemi and Ali Elqursh},
  journal= {arXiv preprint arXiv:1704.03162},
  year   = {2017}
}