中文

ViCo:来自视觉共现的词嵌入

计算机视觉与模式识别 2019-08-23 v1 计算与语言

摘要

我们提出从视觉共现中学习词嵌入。如果两个词都适用于同一图像或图像区域,则这两个词在视觉上共现。具体来说,我们从大规模、带文本标注的视觉数据库(如 VisualGenome 和 ImageNet)中提取物体词与属性词之间的四种视觉共现类型。然后,我们训练一个多任务对数双线性模型,将每种共现类型所表示的词“含义”紧凑地编码到单个视觉词向量中。通过无监督聚类、有监督划分和类似零样本的泛化分析,我们表明我们的词嵌入通过更好地表示仅从文本语料库难以获得的视觉概念之间的相似性与差异性,补充了像 GloVe 这样的纯文本嵌入。我们进一步在五个下游应用上评估了我们的嵌入,其中四个是视觉-语言任务。将 GloVe 与我们的嵌入相结合,在所有任务上都取得了增益。我们还发现,与常规认知相反,随机嵌入在所有有监督视觉-语言任务上的表现与学习到的嵌入相当。

关键词

引用

@article{arxiv.1908.08527,
  title  = {ViCo: Word Embeddings from Visual Co-occurrences},
  author = {Tanmay Gupta and Alexander Schwing and Derek Hoiem},
  journal= {arXiv preprint arXiv:1908.08527},
  year   = {2019}
}

备注

Accepted to ICCV 2019. Project Page: http://tanmaygupta.info/vico/