中文

用于小样本学习的多模态原型网络

计算机视觉与模式识别 2020-11-19 v1 机器学习

摘要

尽管 SOTA 深度学习算法在许多计算机视觉任务中取得了卓越成果,但在低数据场景下却遭遇灾难性的困难。然而,如果存在额外模态的数据(如文本),则可以弥补数据的缺乏并改善分类结果。为了克服这种数据稀缺性,我们设计了一个跨模态特征生成框架,利用来自辅助模态的数据,能够在小样本场景下丰富稀疏的嵌入空间。具体而言,我们训练了一个生成模型,将文本数据映射到视觉特征空间以获得更可靠的原型。这使得在训练期间能够利用来自额外模态(如文本)的数据,而测试时的最终任务仍然是仅使用视觉数据进行分类。我们表明,在这种情况下,最近邻分类是一种可行的方法,并且在 CUB-200 和 Oxford-102 数据集上优于 SOTA 的单模态和多模态小样本学习方法。

关键词

引用

@article{arxiv.2011.08899,
  title  = {Multimodal Prototypical Networks for Few-shot Learning},
  author = {Frederik Pahde and Mihai Puscas and Tassilo Klein and Moin Nabi},
  journal= {arXiv preprint arXiv:2011.08899},
  year   = {2020}
}

备注

To appear at WACV 2021