中文

基于类别特定视觉-语义映射的零样本学习

计算机视觉与模式识别 2017-12-14 v2

摘要

零样本学习(ZSL)旨在基于可见类别的训练实例对来自不可见类别的测试实例进行分类,其中可见类别与不可见类别之间的鸿沟通常通过低层视觉特征空间与中间语义空间之间的视觉-语义映射来弥合。然而,基于可见类别学到的视觉-语义映射可能无法很好地泛化到不可见类别,因为可见类别与不可见类别的数据分布差异显著,这即是 ZSL 中已知的投影域偏移问题。为解决该域偏移问题,我们提出一种名为自适应嵌入 ZSL(AEZSL)的方法,基于每个不可见类别与所有可见类别之间的相似性,为每个不可见类别学习自适应的视觉-语义映射。进而,我们基于 AEZSL 方法做了两方面的扩展。首先,为利用来自不可见类别的无标签测试实例,我们将 AEZSL 扩展为一种半监督方法,称为带标签精炼的 AEZSL(AEZSL_LR),其中开发了一种渐进式方法,基于测试实例之间及不可见类别之间的相似性交替更新视觉分类器并精炼预测的测试标签。其次,为避免在大规模分类任务中为各不可见类别学习视觉-语义映射,我们将 AEZSL 扩展为一种深度自适应嵌入模型,称为深度 AEZSL(DAEZSL),其共享与 AEZSL 相似的思想(即视觉-语义映射应是类别特定的且与语义空间相关),该模型只需训练一次,便可应用于任意数量的不可见类别。大量实验表明,我们所提方法在四个基准数据集上取得了图像分类的 SOTA 结果。

关键词

引用

@article{arxiv.1711.06167,
  title  = {Zero-Shot Learning via Category-Specific Visual-Semantic Mapping},
  author = {Li Niu and Jianfei Cai and Ashok Veeraraghavan},
  journal= {arXiv preprint arXiv:1711.06167},
  year   = {2017}
}