基于视觉语义嵌入的广义零样本识别
计算机视觉与模式识别
2019-04-10 v2
摘要
我们提出了一种新颖的广义零样本学习(GZSL)方法,该方法在训练期间对未见图像和未见语义向量均不可知。在此背景下,先前的工作提出将高维视觉特征映射到语义域,我们认为这会导致语义鸿沟。为了弥合这一鸿沟,我们提出了一种新颖的视觉实例低维嵌入,该嵌入是“视觉语义的”。与量化呈现实例中属性存在性的语义数据类似,我们的视觉嵌入的分量量化了呈现实例中原型部件类型的存在性。同时,作为一项思想实验,我们利用新颖的视觉预言机在视觉上监督学习者,以量化噪声语义数据的影响。这些因素,即语义噪声、视觉-语义鸿沟和标签噪声,促使我们提出了一种新的图模型,用于在标签、语义数据和输入之间进行成对交互的推断。我们在多个基准数据集上列出了结果,表明在语义和视觉监督下,准确率均显著优于现有技术(SOTA)。
引用
@article{arxiv.1811.07993,
title = {Generalized Zero-Shot Recognition based on Visually Semantic Embedding},
author = {Pengkai Zhu and Hanxiao Wang and Venkatesh Saligrama},
journal= {arXiv preprint arXiv:1811.07993},
year = {2019}
}
备注
Accepted in CVPR209. 9 pages, 3 figures, 6 tables