面向少样本细粒度识别的跨模态幻觉
计算机视觉与模式识别
2018-06-15 v2 多媒体
摘要
最先进的深度学习算法通常需要大量数据用于模型训练。数据匮乏会严重恶化性能,尤其在类别间细粒度边界明显的场景中。为此,我们提出一种多模态方法,借助有意义的联合嵌入来弥合信息鸿沟。具体地,我们给出一个训练时多模态(即图像与文本)、测试时单模态(即图像)的基准,其相关任务为利用基类(多样本)中的多模态数据,为 novel 类(少样本)学习显式视觉分类器。接下来,我们提出一个基于跨模态数据幻觉思想的框架。在这方面,我们引入一个判别性文本条件 GAN 用于样本生成,并采用简单的自步策略进行样本选择。我们在 CUB 数据集上展示了所提判别性幻觉方法在 1-、2- 和 5-shot 学习上的结果,表明利用多模态数据可提升准确率。
引用
@article{arxiv.1806.05147,
title = {Cross-modal Hallucination for Few-shot Fine-grained Recognition},
author = {Frederik Pahde and Patrick Jähnichen and Tassilo Klein and Moin Nabi},
journal= {arXiv preprint arXiv:1806.05147},
year = {2018}
}
备注
CVPR 2018 Workshop on Fine-Grained Visual Categorization