何处着眼:视觉问答的聚焦区域
计算机视觉与模式识别
2016-01-12 v2
摘要
我们提出一种通过选择与基于文本的查询相关的图像区域来学习回答视觉问题的方法。我们的方法在回答诸如“什么颜色”(需要评估特定位置)和“什么房间”(选择性识别信息性图像区域)之类的问题上表现出显著改进。我们的模型在VQA数据集上进行了测试,据我们所知该数据集是最大的人标视觉问答数据集。
引用
@article{arxiv.1511.07394,
title = {Where To Look: Focus Regions for Visual Question Answering},
author = {Kevin J. Shih and Saurabh Singh and Derek Hoiem},
journal= {arXiv preprint arXiv:1511.07394},
year = {2016}
}
备注
Submitted to CVPR2016