中文

解释 vs 注意力:用于获取 VQA 注意力的双人博弈

计算机视觉与模式识别 2019-11-21 v1 机器学习 多媒体 图像与视频处理

摘要

在本文中,我们旨在为视觉问答(VQA)任务获取改进的注意力。为注意力提供监督是具有挑战性的。我们的一个观察是,通过类激活映射(具体为 Grad-CAM)获得的视觉解释本用于解释各种网络的性能,其可构成一种监督手段。然而,由于注意力图与 Grad-CAM 的分布不同,直接将其用作监督形式并不合适。相反,我们提出使用一种判别器来区分视觉解释样本与注意力图样本。将注意力区域作为注意力与解释之间双人博弈的对抗训练,有助于使注意力图与视觉解释的分布更接近。显著地,我们观察到提供此种监督手段也导致注意力图与人类注意力更密切相关,从而比基线堆叠注意力网络(SAN)模型有实质性改进。它还在 VQA 任务的秩相关度量上带来良好改进。该方法也可与近期基于 MCB 的方法结合并带来一致改进。我们还提供了与基于相关对齐(Coral)、最大均值差异(MMD)和均方误差(MSE)损失的其他学习分布手段的比较,并观察到对抗损失优于其他学习注意力图的形式。结果可视化也证实了我们的假设,即注意力图通过此种监督形式得以改进。

关键词

引用

@article{arxiv.1911.08618,
  title  = {Explanation vs Attention: A Two-Player Game to Obtain Attention for VQA},
  author = {Badri N. Patro and Anupriy and Vinay P. Namboodiri},
  journal= {arXiv preprint arXiv:1911.08618},
  year   = {2019}
}

备注

AAAI-2020(Accepted)