中文

Action2Vec:一种面向动作学习的跨模态嵌入方法

计算机视觉与模式识别 2019-01-03 v1

摘要

我们描述了一种新颖的面向动作的跨模态嵌入空间,名为 Action2Vec,它将来自类标签的语言线索与从视频片段中导出的时空特征相结合。我们的方法使用分层循环网络来捕捉视频特征的时间结构。我们使用结合了分类准确率与 Word2Vec 语义相似度的联合损失来训练我们的嵌入。我们通过执行零样本动作识别来评估 Action2Vec,并在三个标准数据集上获得了 SOTA 结果。此外,我们提出了两种新颖的类比测试,以量化我们的联合嵌入捕捉分布语义的程度。这是首个结合动词与动作视频的联合嵌入空间,也是首个针对其分布语义进行彻底评估的嵌入空间。

关键词

引用

@article{arxiv.1901.00484,
  title  = {Action2Vec: A Crossmodal Embedding Approach to Action Learning},
  author = {Meera Hahn and Andrew Silva and James M. Rehg},
  journal= {arXiv preprint arXiv:1901.00484},
  year   = {2019}
}