中文

面向广义零样本学习的多模态集成分类

计算机视觉与模式识别 2019-02-07 v2

摘要

广义零样本学习(GZSL)的定义为:训练过程包含来自可见类的视觉样本集合以及来自可见类与不可见类的语义样本集合,而测试过程则包括对来自可见类与不可见类的视觉样本进行分类。当前方法基于仅关注其中一种模态(视觉或语义)的测试过程,即便训练使用了两种模态(多用于正则化训练过程)。这种对模态的利用不足,尤其在测试期间,会阻碍方法的分类准确率。此外,我们注意到鲜有研究致力于开发显式优化可见类与不可见类均衡性能的学习方法。该问题正是 GZSL 方法中可见类分类准确率远高于不可见类的原因之一。在本文中,我们通过提出一种基于多模态训练与测试过程的新 GZSL 方法来缓解这些问题,其中优化显式促进了可见类与不可见类之间的均衡分类准确率。此外,我们探索了视觉与语义分类器的贝叶斯推断,这也是我们在 GZSL 框架中的另一创新点。实验表明,我们的方法在多个公开 GZSL 基准上就可见类与不可见类之间的调和平均(H-mean)分类以及可见与不可见曲线下面积(AUSUC)而言保持了最先进(SOTA)结果。

关键词

引用

@article{arxiv.1901.04623,
  title  = {Multi-modal Ensemble Classification for Generalized Zero Shot Learning},
  author = {Rafael Felix and Michele Sasdelli and Ian Reid and Gustavo Carneiro},
  journal= {arXiv preprint arXiv:1901.04623},
  year   = {2019}
}

备注

10 pages, 3 Figures, 4 Tables