学习用于零样本学习的深度嵌入模型
计算机视觉与模式识别
2019-07-22 v4
摘要
零样本学习(ZSL)模型依赖于学习一个联合嵌入空间,在该空间中,对象类别的文本/语义描述与对象图像的视觉表示均可被投影,以进行最近邻搜索。尽管深度神经网络在其他视觉问题(如图像描述)中成功学习了文本与图像之间的端到端模型,但深度ZSL模型却很少存在,且与利用深度特征表示但未学习端到端嵌入的ZSL模型相比,它们几乎没有显示出优势。在本文中,我们认为使深度ZSL模型成功的关键在于选择正确的嵌入空间。我们提出使用视觉空间作为嵌入空间,而非嵌入到语义空间或中间空间。这是因为在该空间中,后续的最近邻搜索受中心度问题的影响会小得多,从而变得更加有效。该模型设计还为多种语义模态(例如,属性和句子描述)以端到端方式联合融合与优化提供了一种自然机制。在四个基准数据集上的大量实验表明,我们的模型显著优于现有模型。代码可在https://github.com/lzrobots/DeepEmbeddingModel_ZSL获取。
引用
@article{arxiv.1611.05088,
title = {Learning a Deep Embedding Model for Zero-Shot Learning},
author = {Li Zhang and Tao Xiang and Shaogang Gong},
journal= {arXiv preprint arXiv:1611.05088},
year = {2019}
}
备注
CVPR2017. Adding GZSL results. Code is available at https://github.com/lzrobots/DeepEmbeddingModel_ZSL