MUREL:用于视觉问答的多模态关系推理
计算机视觉与模式识别
2019-02-26 v1 人工智能
计算与语言
机器学习
摘要
多模态注意力网络是当前涉及真实图像的视觉问答(VQA)任务中最先进的模型。尽管注意力允许聚焦于与问题相关的视觉内容,这一简单机制尚不足以建模VQA或其他高层任务所需的复杂推理特征。本文中,我们提出MuRel,一种端到端学习的多模态关系网络,用于对真实图像进行推理。我们的首要贡献是引入MuRel单元,一种原子推理原语,通过丰富向量表示刻画问题与图像区域间的交互,并以成对组合建模区域关系。其次,我们将该单元嵌入完整的MuRel网络,其逐步精炼视觉与问题的交互,并可用于定义比单纯注意力图更精细的可视化方案。我们通过多种消融研究验证方法的相关性,并展示其在三个数据集VQA 2.0、VQA-CP v2和TDIUC上相对于基于注意力的方法的优越性。我们最终的MuRel网络在这一挑战性背景下达到或超越最先进结果。我们的代码可用:https://github.com/Cadene/murel.bootstrap.pytorch
引用
@article{arxiv.1902.09487,
title = {MUREL: Multimodal Relational Reasoning for Visual Question Answering},
author = {Remi Cadene and Hedi Ben-younes and Matthieu Cord and Nicolas Thome},
journal= {arXiv preprint arXiv:1902.09487},
year = {2019}
}
备注
CVPR2019 accepted paper