中文

基于视觉语义嵌入的广义零样本识别

计算机视觉与模式识别 2019-04-10 v2

摘要

我们提出了一种新颖的广义零样本学习(GZSL)方法,该方法在训练期间对未见图像和未见语义向量均不可知。在此背景下,先前的工作提出将高维视觉特征映射到语义域,我们认为这会导致语义鸿沟。为了弥合这一鸿沟,我们提出了一种新颖的视觉实例低维嵌入,该嵌入是“视觉语义的”。与量化呈现实例中属性存在性的语义数据类似,我们的视觉嵌入的分量量化了呈现实例中原型部件类型的存在性。同时,作为一项思想实验,我们利用新颖的视觉预言机在视觉上监督学习者,以量化噪声语义数据的影响。这些因素,即语义噪声、视觉-语义鸿沟和标签噪声,促使我们提出了一种新的图模型,用于在标签、语义数据和输入之间进行成对交互的推断。我们在多个基准数据集上列出了结果,表明在语义和视觉监督下,准确率均显著优于现有技术(SOTA)。

关键词

引用

@article{arxiv.1811.07993,
  title  = {Generalized Zero-Shot Recognition based on Visually Semantic Embedding},
  author = {Pengkai Zhu and Hanxiao Wang and Venkatesh Saligrama},
  journal= {arXiv preprint arXiv:1811.07993},
  year   = {2019}
}

备注

Accepted in CVPR209. 9 pages, 3 figures, 6 tables