中文

用于缩小视觉-语言任务中语义鸿沟的语言感知注意力

计算机视觉与模式识别 2021-08-27 v1

摘要

注意力模型广泛用于视觉-语言(V-L)任务中以执行视觉-文本关联。人类借助对视觉世界的强烈语言理解来进行此类关联。然而,即便 V-L 任务中性能最佳的注意力模型也缺乏此种高层语言理解,从而在模态间产生语义鸿沟。本文提出一种注意力机制——语言感知注意力(LAT)——利用通用目标检测器获得的物体属性与预训练语言模型来缩小该语义鸿沟。LAT 在共同的语言丰富空间中表示视觉与文本模态,从而赋予注意力过程语言感知能力。我们在三项 V-L 任务中应用并证明了 LAT 的有效性:Counting-VQA、VQA 与图像描述。在 Counting-VQA 中,我们提出一种新颖的计数专用 VQA 模型以预测直观计数,并在五个数据集上取得最先进(SOTA)结果。在 VQA 与描述任务中,我们将 LAT 适配进多种基线并持续提高其性能,展示了其通用性与有效性。

关键词

引用

@article{arxiv.2008.08012,
  title  = {Linguistically-aware Attention for Reducing the Semantic-Gap in Vision-Language Tasks},
  author = {Gouthaman KV and Athira Nambiar and Kancheti Sai Srinivas and Anurag Mittal},
  journal= {arXiv preprint arXiv:2008.08012},
  year   = {2021}
}