中文

利用带语义概念的多模态变分自编码器进行广义零样本学习

计算机视觉与模式识别 2021-06-29 v1 人工智能

摘要

随着数据量的不断增长,多模态学习的核心挑战在于标注样本的局限性。对于分类任务,元学习、零样本学习与少样本学习等技术展示了基于先验知识学习新类别信息的能力。近期技术试图学习语义空间与图像空间之间的跨模态映射。然而,它们往往忽略局部与全局语义知识。为克服该问题,我们提出一种多模态变分自编码器(M-VAE),其可学习图像特征与语义空间的共享潜在空间。在我们的方法中,我们将多模态数据拼接为单一嵌入,再送入 VAE 以学习潜在空间。我们提出在通过解码器重构特征嵌入时使用多模态损失。我们的方法能够关联模态并利用局部与全局语义知识进行新样本预测。我们在四个基准数据集上使用 MLP 分类器的实验结果表明,所提模型在广义零样本学习上优于当前最先进的方法。

关键词

引用

@article{arxiv.2106.14082,
  title  = {Generalized Zero-Shot Learning using Multimodal Variational Auto-Encoder with Semantic Concepts},
  author = {Nihar Bendre and Kevin Desai and Peyman Najafirad},
  journal= {arXiv preprint arXiv:2106.14082},
  year   = {2021}
}

备注

5 pages, 2 figures, 2 tables