SEMBED:第一人称动作视频语义嵌入
计算机视觉与模式识别
2016-08-01 v2
摘要
我们提出了 SEMBED,这是一种将第一人称物体交互视频嵌入语义 - 视觉图以估计其潜在语义标签概率分布的方法。当使用无界选择的动词对物体交互进行标注时,我们通过捕捉运动和外观特征上的语义关系以及视觉相似性,来利用这些标签的丰富性和歧义性。我们展示了 SEMBED 如何解释包含 1225 个自由标注的第一人称视频的挑战性数据集,其表现优于 SVM 分类超过 5%。
引用
@article{arxiv.1607.08414,
title = {SEMBED: Semantic Embedding of Egocentric Action Videos},
author = {Michael Wray and Davide Moltisanti and Walterio Mayol-Cuevas and Dima Damen},
journal= {arXiv preprint arXiv:1607.08414},
year = {2016}
}