中文

Objects2action:无需视频示例的动作分类与定位

计算机视觉与模式识别 2015-10-26 v1

摘要

本文的目标是在无需示例的情况下识别视频中的动作。与传统的零样本(zero-shot)方法不同,我们不要求设计和指定属性分类器以及类到属性的映射,以实现从已见类别到未见类别的迁移。我们的关键贡献是 objects2action,一种由数千个物体类别的 skip-gram 模型所张成的语义词嵌入。基于动作与物体亲和度的凸组合,将动作标签分配给未见视频的物体编码。我们的语义嵌入具有三个主要特性以适应动作的特殊性。首先,我们提出了一种利用动作和物体的多词描述的机制。其次,我们引入了针对每个动作最响应物体的自动选择。最后,我们展示了如何将我们的零样本方法扩展到视频中动作的时空定位。在四个动作数据集上的实验证明了我们方法的潜力。

关键词

引用

@article{arxiv.1510.06939,
  title  = {Objects2action: Classifying and localizing actions without any video example},
  author = {Mihir Jain and Jan C. van Gemert and Thomas Mensink and Cees G. M. Snoek},
  journal= {arXiv preprint arXiv:1510.06939},
  year   = {2015}
}