基于重建的图像中文本短语定位
计算机视觉与模式识别
2017-02-21 v4 计算与语言
机器学习
摘要
在视觉内容中对任意、自由形式的文本短语进行定位(即局部化)是一个具有挑战性的问题,在人机交互和图文指代消解方面有许多应用。很少有数据集提供短语的真实空间定位,因此期望从没有或很少定位监督的数据中学习。我们提出了一种新方法,通过使用注意力机制重建给定短语来学习定位,该注意力机制可以是潜在的或直接计算优化的。在训练期间,我们的方法使用循环网络语言模型对短语进行编码,然后学习关注相关的图像区域以重建输入短语。在测试时,评估正确的注意力,即定位。如果存在定位监督,则可以通过注意力机制上的损失直接应用。我们在 Flickr 30k Entities 和 ReferItGame 数据集上展示了我们的方法在不同监督水平下的有效性,范围从无监督、部分监督到完全监督。我们的监督变体在两个数据集上均以大幅优势超越了 state-of-the-art。
引用
@article{arxiv.1511.03745,
title = {Grounding of Textual Phrases in Images by Reconstruction},
author = {Anna Rohrbach and Marcus Rohrbach and Ronghang Hu and Trevor Darrell and Bernt Schiele},
journal= {arXiv preprint arXiv:1511.03745},
year = {2017}
}
备注
published at ECCV 2016 (oral); updated to final version