展示、询问、注意力与回答:视觉问答的一个强基线
计算机视觉与模式识别
2017-04-13 v2
摘要
本文提出了一种用于视觉问答任务的新基线。给定一幅图像和一个自然语言问题,我们的模型根据图像内容生成准确的答案。我们的模型在架构上简单且可训练参数相对较少,却在非平衡和平衡 VQA 基准上都设定了新的 state of the art。在 VQA 1.0 开放式挑战中,我们的模型在不使用额外数据的情况下在 test-standard 集上达到了 64.6% 的准确率,比 state of the art 提高了 0.4%;在新发布的 VQA 2.0 上,我们的模型在验证集上取得了 59.7% 的分数,比先前报道的最佳结果高出 0.5%。本文呈现的结果尤其有趣,因为之前已尝试过非常相似的模型但报告的性能明显更低。鉴于这些新结果,我们希望未来能看到更多关于视觉问答的有意义研究。
引用
@article{arxiv.1704.03162,
title = {Show, Ask, Attend, and Answer: A Strong Baseline For Visual Question Answering},
author = {Vahid Kazemi and Ali Elqursh},
journal= {arXiv preprint arXiv:1704.03162},
year = {2017}
}