中文

学习视觉注意力一致性以进行视觉常识推理

计算机视觉与模式识别 2023-02-21 v2

摘要

视觉常识推理(VCR)仍然是视觉推理领域中一个重要但具有挑战性的研究问题。VCR 模型通常旨在回答关于图像的文本问题,然后对前面的回答过程进行理由预测。尽管这两个过程是顺序进行且相互交织的,但现有方法总是将它们视为两个独立的基于匹配的实例。因此,它们忽略了这两个过程之间的关键关系,导致模型性能次优。本文提出了一种新颖的视觉注意力对齐方法,以在一个统一的框架中有效处理这两个过程。为此,我们首先设计了一个重注意力模块,用于聚合每个过程中产生的视觉注意力图。然后,仔细对齐得到的两组注意力图,以引导这两个过程基于相同的图像区域做出决策。我们将此方法应用于传统的注意力和最近的 Transformer 模型,并在 VCR 基准数据集上进行了广泛的实验。结果表明,通过注意力对齐模块,我们的方法相比基线方法取得了显著的改进,清晰地揭示了耦合这两个过程的可行性以及所提方法的有效性。

关键词

引用

@article{arxiv.2302.02117,
  title  = {Learning to Agree on Vision Attention for Visual Commonsense Reasoning},
  author = {Zhenyang Li and Yangyang Guo and Kejie Wang and Fan Liu and Liqiang Nie and Mohan Kankanhalli},
  journal= {arXiv preprint arXiv:2302.02117},
  year   = {2023}
}