中文

基于词向量嵌入的直推式零样本动作识别

计算机视觉与模式识别 2016-12-05 v2

摘要

动作识别的类别数量正在迅速增长,为所有类别标注足够训练数据以学习常规模型已变得越来越困难。相较于收集更多数据并为所有类别详尽标注,一种吸引人的替代方法是“零样本学习”(ZSL)。为此,本研究构建了视觉特征与每个动作类别的语义描述符之间的映射,使得在新类别没有任何视觉训练数据的情况下也能被识别。现有 ZSL 研究主要关注静态图像以及基于属性的语义表示。本工作中,我们探索使用词向量作为共享语义空间,以嵌入视频和类别标签,用于 ZSL 动作识别。这比现有的静态图像和/或基于属性的 ZSL 更具挑战性,因为动作的视频时空特征与语义空间之间的映射更为复杂,且难以学习,以便在任何跨类别域偏移上泛化。为解决 ZSL 动作识别中的该泛化问题,我们研究了一系列协同策略以改进标准 ZSL 流程。这些策略大多本质上是直推式的,即在训练阶段可访问测试数据。

关键词

引用

@article{arxiv.1511.04458,
  title  = {Transductive Zero-Shot Action Recognition by Word-Vector Embedding},
  author = {Xun Xu and Timothy Hospedales and Shaogang Gong},
  journal= {arXiv preprint arXiv:1511.04458},
  year   = {2016}
}

备注

Accepted by IJCV