中文

面向少样本细粒度识别的跨模态幻觉

计算机视觉与模式识别 2018-06-15 v2 多媒体

摘要

最先进的深度学习算法通常需要大量数据用于模型训练。数据匮乏会严重恶化性能,尤其在类别间细粒度边界明显的场景中。为此,我们提出一种多模态方法,借助有意义的联合嵌入来弥合信息鸿沟。具体地,我们给出一个训练时多模态(即图像与文本)、测试时单模态(即图像)的基准,其相关任务为利用基类(多样本)中的多模态数据,为 novel 类(少样本)学习显式视觉分类器。接下来,我们提出一个基于跨模态数据幻觉思想的框架。在这方面,我们引入一个判别性文本条件 GAN 用于样本生成,并采用简单的自步策略进行样本选择。我们在 CUB 数据集上展示了所提判别性幻觉方法在 1-、2- 和 5-shot 学习上的结果,表明利用多模态数据可提升准确率。

关键词

引用

@article{arxiv.1806.05147,
  title  = {Cross-modal Hallucination for Few-shot Fine-grained Recognition},
  author = {Frederik Pahde and Patrick Jähnichen and Tassilo Klein and Moin Nabi},
  journal= {arXiv preprint arXiv:1806.05147},
  year   = {2018}
}

备注

CVPR 2018 Workshop on Fine-Grained Visual Categorization