MUTATT:用于指代表达理解的视觉-文本互导方法
计算机视觉与模式识别
2020-03-23 v2
摘要
指代表达理解(REC)旨在利用自然语言中的指代表达在给定图像中定位文本相关区域。现有方法侧重于如何独立地构建令人信服的视觉与语言表示,这可能显著隔离视觉与语言信息。本文中,我们认为对于REC,指代表达与目标区域在语义上相关,且视觉与语言之间存在主体、位置和关系一致性。在此基础上,我们提出一种称为MutAtt的新方法,以构建视觉与语言间的互导,其平等对待视觉与语言从而产出紧凑的信息匹配。具体而言,对于主体、位置和关系每个模块,MutAtt构建两类基于注意力的互导策略。一种策略生成视觉引导的语言嵌入以匹配相关视觉特征。另一种反向生成语言引导的视觉特征以匹配相关语言嵌入。该互导策略能有效保证三个模块中的视觉-语言一致性。在三个流行REC数据集上的实验表明,所提方法优于当前最先进的方法。
引用
@article{arxiv.2003.08027,
title = {MUTATT: Visual-Textual Mutual Guidance for Referring Expression Comprehension},
author = {Shuai Wang and Fan Lyu and Wei Feng and Song Wang},
journal= {arXiv preprint arXiv:2003.08027},
year = {2020}
}
备注
6 pages, Accepted by ICME-2020