中文

基于GAN的视觉数据合成用于零样本视频分类

计算机视觉与模式识别 2018-04-27 v1

摘要

视频分类中的零样本学习(ZSL)是一个有前景的研究方向,旨在应对视频类别爆炸式增长的挑战。大多数现有方法通过在学习视觉与语义空间之间的投影来利用已见类到未见类的关联。然而,此类基于投影的范式无法充分利用数据分布中隐含的判别信息,且通常受“异质鸿沟”引起的信息退化问题困扰。本文中,我们提出一种基于GAN的视觉数据合成框架以解决这些问题。具体而言,语义知识与视觉分布均被利用来合成未见类别的视频特征,且借助合成特征ZSL可转化为典型的监督问题。首先,我们提出多级语义推断以提升视频特征合成,其通过特征级和标签级语义推断捕获联合视觉-语义分布中隐含的判别信息。其次,我们提出匹配感知互信息关联以克服信息退化问题,其通过互信息捕获匹配与不匹配的视觉-语义对中的已见类到未见类关联,为零样本合成过程提供鲁棒引导信号。在四个视频数据集上的实验结果表明,我们的方法能显著提升零样本视频分类性能。

关键词

引用

@article{arxiv.1804.10073,
  title  = {Visual Data Synthesis via GAN for Zero-Shot Video Classification},
  author = {Chenrui Zhang and Yuxin Peng},
  journal= {arXiv preprint arXiv:1804.10073},
  year   = {2018}
}

备注

7 pages, accepted by International Joint Conference on Artificial Intelligence (IJCAI) 2018