中文

零样本动作识别的语义嵌入空间

计算机视觉与模式识别 2015-11-17 v1

摘要

动作识别的类别数量正在迅速增长。因此,为每个类别收集足够的训练数据以学习常规模型变得越来越困难。这一难题可通过日益流行的“零样本学习”(zero-shot learning, ZSL)范式缓解。在该框架中,构建视觉特征与每个类别的人类可解释语义描述之间的映射,从而在没有训练数据的情况下识别类别。现有的 ZSL 研究主要关注图像数据以及基于属性的语义表示。本文中,我们解决现代视频动作识别任务中的零样本识别问题,使用语义词向量空间作为嵌入视频和类别标签的公共空间。这更具挑战性,因为包含复杂动作的视频的语义空间与时空特征之间的映射更为复杂且难以学习。我们证明,简单的自训练(self-training)与数据增强(data augmentation)策略能显著提升该映射的有效性。在包括 HMDB51 和 UCF101 在内的人体动作数据集上的实验表明,我们的方法实现了最先进的(state-of-the-art, SOTA)零样本动作识别性能。

关键词

引用

@article{arxiv.1502.01540,
  title  = {Semantic Embedding Space for Zero-Shot Action Recognition},
  author = {Xun Xu and Timothy Hospedales and Shaogang Gong},
  journal= {arXiv preprint arXiv:1502.01540},
  year   = {2015}
}

备注

5 pages