基于第三人称视角的第一人称视频摘要生成
计算机视觉与模式识别
2018-07-27 v2
摘要
视频精彩片段提取或摘要生成是计算机视觉中引人关注的话题之一,其有益于浏览、检索或存储等多种应用。然而,现有多数研究依赖于第三人称视频的训练数据,难以泛化至第一人称视频的精彩片段提取。为推导一种有效的第一人称视频摘要模型,我们提出了一种新颖的深度神经网络架构,用于描述和区分跨不同视角视频中的关键时空信息。我们所提模型在半监督设定下实现,训练时输入完全标注的第三人称视频、未标注的第一人称视频以及少量标注的第一人称视频。在实验中,我们在基准数据集及自行收集的第一人称视频数据集上给出了定性与定量评估。
引用
@article{arxiv.1711.08922,
title = {Summarizing First-Person Videos from Third Persons' Points of Views},
author = {Hsuan-I Ho and Wei-Chen Chiu and Yu-Chiang Frank Wang},
journal= {arXiv preprint arXiv:1711.08922},
year = {2018}
}
备注
16+10 pages, ECCV 2018