视觉问答中的人类注意力:人类与深度网络关注的是相同的区域吗?
计算机视觉与模式识别
2016-06-20 v2 计算与语言
摘要
我们在视觉问答(VQA)中对“人类注意力”进行了大规模研究,以理解人类在回答关于图像的问题时选择关注哪里。我们设计并测试了多种受游戏启发的全新注意力标注界面,要求受试者锐化模糊图像中的区域以回答问题。由此,我们引入了 VQA-HAT(Human ATtention)数据集。我们通过定性(通过可视化)和定量(通过秩相关)评估了最先进的 VQA 模型生成的注意力图与人类注意力之间的差异。总体而言,我们的实验表明,当前 VQA 中的注意力模型似乎并未关注与人类相同的区域。
关键词
引用
@article{arxiv.1606.03556,
title = {Human Attention in Visual Question Answering: Do Humans and Deep Networks Look at the Same Regions?},
author = {Abhishek Das and Harsh Agrawal and C. Lawrence Zitnick and Devi Parikh and Dhruv Batra},
journal= {arXiv preprint arXiv:1606.03556},
year = {2016}
}
备注
9 pages, 6 figures, 3 tables; Under review at EMNLP 2016