Align2Ground:由图文对齐引导的弱监督短语定位
计算机视觉与模式识别
2019-10-16 v2
摘要
我们研究利用图像- caption 对中的弱监督来定位自由形式文本短语的问题。我们提出了一种新颖的端到端模型,该模型使用 caption 到图像的检索作为“下游”任务来引导短语定位的过程。我们的方法作为第一步,推断感兴趣区域(RoIs)与 caption 中短语之间的潜在对应关系,并利用这些匹配的 RoIs 构建判别性图像表示。在后续步骤中,该(学习到的)表示与 caption 对齐。我们的关键贡献在于构建这种“以 caption 为条件”的图像编码,它将两个任务紧密耦合,并允许弱监督有效地引导视觉定位。我们提供了广泛的实证与定性分析,以研究所提出模型的不同组成部分,并与具有竞争力的基线进行比较。对于短语定位,我们在 VisualGenome 数据集上报告了比先前最先进(SOTA)方法绝对提升 4.9%。我们还报告了在 COCO 和 Flickr30k 数据集的下游 caption 到图像检索任务上与最先进(SOTA)方法相当的结果。
引用
@article{arxiv.1903.11649,
title = {Align2Ground: Weakly Supervised Phrase Grounding Guided by Image-Caption Alignment},
author = {Samyak Datta and Karan Sikka and Anirban Roy and Karuna Ahuja and Devi Parikh and Ajay Divakaran},
journal= {arXiv preprint arXiv:1903.11649},
year = {2019}
}
备注
v2 contains phrase localization results on Flickr30k Entities. Accepted for publication at ICCV 2019