中文

用于视觉问答的结构化注意力

计算机视觉与模式识别 2017-08-08 v1

摘要

视觉注意力根据图像区域与问题的相关性为其分配权重,被大多数视觉问答模型视为不可或缺的一部分。尽管问题可能涉及多个区域之间的复杂关系,但很少有注意力模型能够有效编码这种跨区域关系。在本文中,我们通过展示 ResNet 在两个数据集上有限的有效感受野来证明编码此类关系的重要性,并提出将视觉注意力建模为图像区域上网格结构条件随机场的多变量分布。我们展示了如何将迭代推理算法(平均场和循环置信传播)转换为端到端神经网络的循环层。我们在 3 个数据集上对模型进行了实证评估,在 CLEVR 数据集上超越了最新发布的最佳基线模型 9.5%,在 VQA 数据集上超越了已发表的最佳模型 1.25%。源代码可在 https://github.com/zhuchen03/vqa-sva 获取。

关键词

引用

@article{arxiv.1708.02071,
  title  = {Structured Attentions for Visual Question Answering},
  author = {Chen Zhu and Yanpeng Zhao and Shuaiyi Huang and Kewei Tu and Yi Ma},
  journal= {arXiv preprint arXiv:1708.02071},
  year   = {2017}
}

备注

ICCV2017