中文

基于重建的图像中文本短语定位

计算机视觉与模式识别 2017-02-21 v4 计算与语言 机器学习

摘要

在视觉内容中对任意、自由形式的文本短语进行定位(即局部化)是一个具有挑战性的问题,在人机交互和图文指代消解方面有许多应用。很少有数据集提供短语的真实空间定位,因此期望从没有或很少定位监督的数据中学习。我们提出了一种新方法,通过使用注意力机制重建给定短语来学习定位,该注意力机制可以是潜在的或直接计算优化的。在训练期间,我们的方法使用循环网络语言模型对短语进行编码,然后学习关注相关的图像区域以重建输入短语。在测试时,评估正确的注意力,即定位。如果存在定位监督,则可以通过注意力机制上的损失直接应用。我们在 Flickr 30k Entities 和 ReferItGame 数据集上展示了我们的方法在不同监督水平下的有效性,范围从无监督、部分监督到完全监督。我们的监督变体在两个数据集上均以大幅优势超越了 state-of-the-art。

关键词

引用

@article{arxiv.1511.03745,
  title  = {Grounding of Textual Phrases in Images by Reconstruction},
  author = {Anna Rohrbach and Marcus Rohrbach and Ronghang Hu and Trevor Darrell and Bernt Schiele},
  journal= {arXiv preprint arXiv:1511.03745},
  year   = {2017}
}

备注

published at ECCV 2016 (oral); updated to final version