中文

条件式图像-文本嵌入网络

计算机视觉与模式识别 2018-07-31 v4

摘要

本文提出了一种将图像中的短语进行定位的方法,该方法在单一端到端模型中联合学习多个文本条件嵌入。为了将文本短语区分到语义不同的子空间中,我们提出了一个概念权重分支,能够自动将短语分配给各嵌入,而先前工作需预先定义此类分配。我们提出的方案简化了对单个嵌入的表示要求,并使得代表性不足的概念在进入特定概念层之前能够利用共享表示。综合实验在三个短语定位数据集 Flickr30K Entities、ReferIt Game 和 Visual Genome 上验证了方法的有效性,相较于一个强大的区域-短语嵌入基线,我们的定位性能分别提升了 4%、3% 和 4%。

关键词

引用

@article{arxiv.1711.08389,
  title  = {Conditional Image-Text Embedding Networks},
  author = {Bryan A. Plummer and Paige Kordas and M. Hadi Kiapour and Shuai Zheng and Robinson Piramuthu and Svetlana Lazebnik},
  journal= {arXiv preprint arXiv:1711.08389},
  year   = {2018}
}

备注

ECCV 2018 accepted paper