利用每一图像对象进行半监督短语定位
计算机视觉与模式识别
2020-11-06 v1
摘要
短语定位模型在给定指称表达时定位图像中的对象。训练期间可用的标注语言查询有限,这也限制了模型在训练时能见到的语言组合的变化。在本文中,我们研究在训练半监督短语定位时使用无标注查询的对象的情况。我们提出使用习得的位置与主体嵌入预测器(LSEP)为训练集中缺乏标注查询的对象生成相应语言嵌入。在检测器的辅助下,我们也应用 LSEP 在没有任何标注的图像上训练定位模型。我们基于 MAttNet 在三个公开数据集上评估我们的方法:RefCOCO、RefCOCO+ 和 RefCOCOg。我们表明,我们的预测器使定位系统能从无标注查询的对象学习,并相对借助检测结果将准确率提升 34.9%。
引用
@article{arxiv.2011.02655,
title = {Utilizing Every Image Object for Semi-supervised Phrase Grounding},
author = {Haidong Zhu and Arka Sadhu and Zhaoheng Zheng and Ram Nevatia},
journal= {arXiv preprint arXiv:2011.02655},
year = {2020}
}