多模态循环一致广义零样本学习
计算机视觉与模式识别
2018-08-03 v2
摘要
在广义零样本学习(GZSL)中,类别集合被划分为可见类与不可见类,其中训练依赖于可见类和不可见类的语义特征以及仅可见类的视觉表示,而测试使用可见类和不可见类的视觉表示。当前方法通过将视觉空间到语义空间的变换来应对 GZSL,探究语义空间与视觉空间中类别分布相对相似的假设。此类方法倾向于将不可见的测试视觉表示变换为某个可见类的语义特征,而非正确不可见类的语义特征,导致 GZSL 分类准确率低下。近来,生成对抗网络(GAN)被探索用于从不可见类的语义特征合成其视觉表示——可见类与不可见类的合成表示随后用于训练 GZSL 分类器。该方法已显示出提升 GZSL 分类准确率的成效,然而,无法保证合成的视觉表示能以多模态循环一致的方式回溯生成其语义特征。该约束可能导致合成的视觉表示不能很好地代表其语义特征。在本文中,我们提出基于一种新的 GAN 训练正则化来使用此种约束,迫使生成的视觉特征重建其原始语义特征。一旦我们的模型以这种多模态循环一致语义兼容性训练完成,我们便能合成更具代表性的可见类、且更重要的是不可见类的视觉表示。我们提出的方法在多个公开可用数据集上展示了该领域最佳的 GZSL 分类结果。
引用
@article{arxiv.1808.00136,
title = {Multi-modal Cycle-consistent Generalized Zero-Shot Learning},
author = {Rafael Felix and B. G. Vijay Kumar and Ian Reid and Gustavo Carneiro},
journal= {arXiv preprint arXiv:1808.00136},
year = {2018}
}
备注
Accepted at ECCV 2018, 15th European Conference on Computer Vision, September 8 to 14, 2018