中文

在视觉问答中探索类人注意力监督

计算机视觉与模式识别 2017-09-20 v1

摘要

注意力机制已广泛应用于视觉问答(VQA)任务,因为它有助于聚焦于视觉和文本信息的感兴趣区域。为了正确回答问题,模型需要有选择地定位图像的不同区域,这表明基于注意力的模型可能会从显式注意力监督中受益。在本工作中,我们旨在解决向 VQA 模型添加注意力监督的问题。由于缺乏人类注意力数据,我们首先提出一个人类注意力网络(HAN)来生成类人注意力图,并在最近发布的数据集人类注意力数据集(VQA-HAT)上进行训练。然后,我们将预训练的 HAN 应用于 VQA v2.0 数据集,为所有图像-问题对自动生成类人注意力图。为 VQA v2.0 数据集生成的类人注意力图数据集被命名为类人注意力(HLAT)数据集。最后,我们将类人注意力监督应用于基于注意力的 VQA 模型。实验表明,添加类人监督可产生更准确的注意力以及更好的性能,展示了类人注意力监督在 VQA 中的广阔前景。

关键词

引用

@article{arxiv.1709.06308,
  title  = {Exploring Human-like Attention Supervision in Visual Question Answering},
  author = {Tingting Qiao and Jianfeng Dong and Duanqing Xu},
  journal= {arXiv preprint arXiv:1709.06308},
  year   = {2017}
}