学习跨模态上下文图用于视觉定位
计算机视觉与模式识别
2019-11-26 v2
摘要
视觉定位是许多视觉-语言任务中普遍存在的构建模块,但由于定位实体在视觉与语言特征上的巨大差异、强烈的上下文效应以及由此产生的语义歧义,其仍然具有挑战性。先前的工作通常侧重于在有限上下文信息下学习单个短语的表示。为克服其局限,本文提出一种语言引导的图表示来捕捉定位实体及其关系的全局上下文,并针对多短语视觉定位任务开发了一种跨模态图匹配策略。具体而言,我们引入一个模块化图神经网络,通过消息传播分别计算短语与物体提议的上下文感知表示,随后通过一个基于图的匹配模块生成定位短语的全局一致位置。我们以两阶段策略联合训练整个图神经网络,并在 Flickr30K Entities 基准上对其进行评估。大量实验表明,我们的方法以可观的幅度优于先前的 SOTA,证明了我们定位框架的有效性。代码见 https://github.com/youngfly11/LCMCG-PyTorch。
引用
@article{arxiv.1911.09042,
title = {Learning Cross-modal Context Graph for Visual Grounding},
author = {Yongfei Liu and Bo Wan and Xiaodan Zhu and Xuming He},
journal= {arXiv preprint arXiv:1911.09042},
year = {2019}
}
备注
AAAI-2020