中文

面向视觉问答的注意力引导语义关系解析

计算机视觉与模式识别 2020-10-06 v1 人工智能

摘要

人类用语义标签解释对象间关系,这展现出执行视觉-语言复杂任务(如视觉问答(VQA))所需的高层理解。然而,现有 VQA 模型将关系表示为对象级视觉特征的组合,这限制了模型在单一域内表达对象间交互,而模型正试图解决多模态任务。本文提出一种通用语义关系解析器,为图像中每个主-谓-宾三元组生成语义特征向量,以及一种互注意力与自注意力(MSA)机制,学习识别对回答给定问题重要的关系三元组。为阐明语义关系的重要性,我们展示一个使用真值关系三元组的预言机设定,在此设定下我们的模型在具挑战性的 GQA 数据集上比较接近的 SOTA 模型准确率提升约 25%。进一步,借助我们的语义解析器,我们展示模型在 VQA 与 GQA 数据集上优于其他可比方法。

关键词

引用

@article{arxiv.2010.01725,
  title  = {Attention Guided Semantic Relationship Parsing for Visual Question Answering},
  author = {Moshiur Farazi and Salman Khan and Nick Barnes},
  journal= {arXiv preprint arXiv:2010.01725},
  year   = {2020}
}