面向弱监督指称表达定位的知识引导成对重建网络
计算机视觉与模式识别
2019-09-09 v1
摘要
弱监督指称表达定位(REG)旨在根据语言查询在图像中定位所指实体,其中图像区域(候选框)与查询之间的映射在训练阶段是未知的。在指称表达中,人们通常通过目标实体与其他上下文实体的关系以及视觉属性来描述它。然而,以往的弱监督REG方法很少关注实体间的关系。本文中,我们提出一种知识引导的成对重建网络(KPRN),该网络对目标实体(主体)与上下文实体(客体)之间的关系进行建模,并对这两个实体进行定位。具体来说,我们首先设计了一个知识提取模块,以指导主体和客体的候选框选择。先验知识以每个候选框与主体/客体之间语义相似度的特定形式获得。其次,在此知识的引导下,我们设计了主体和客体注意力模块,以构建主体-客体候选框对。主体注意力从候选框中排除不相关的候选框。客体注意力选择最合适的候选框作为上下文候选框。第三,我们引入成对注意力和自适应加权方案,以学习这些候选框对与查询之间的对应关系。最后,使用成对重建模块来衡量弱监督学习的定位效果。在四个大规模数据集上的大量实验表明,我们的方法以较大优势超越了现有的最先进方法。
引用
@article{arxiv.1909.02860,
title = {Knowledge-guided Pairwise Reconstruction Network for Weakly Supervised Referring Expression Grounding},
author = {Xuejing Liu and Liang Li and Shuhui Wang and Zheng-Jun Zha and Li Su and Qingming Huang},
journal= {arXiv preprint arXiv:1909.02860},
year = {2019}
}
备注
Accepted by ACMMM 2019. arXiv admin note: text overlap with arXiv:1908.10568