中文

SEMBED:第一人称动作视频语义嵌入

计算机视觉与模式识别 2016-08-01 v2

摘要

我们提出了 SEMBED,这是一种将第一人称物体交互视频嵌入语义 - 视觉图以估计其潜在语义标签概率分布的方法。当使用无界选择的动词对物体交互进行标注时,我们通过捕捉运动和外观特征上的语义关系以及视觉相似性,来利用这些标签的丰富性和歧义性。我们展示了 SEMBED 如何解释包含 1225 个自由标注的第一人称视频的挑战性数据集,其表现优于 SVM 分类超过 5%。

关键词

引用

@article{arxiv.1607.08414,
  title  = {SEMBED: Semantic Embedding of Egocentric Action Videos},
  author = {Michael Wray and Davide Moltisanti and Walterio Mayol-Cuevas and Dima Damen},
  journal= {arXiv preprint arXiv:1607.08414},
  year   = {2016}
}