中文

通过从无配对数据中学习实现视频摘要

计算机视觉与模式识别 2019-04-10 v2

摘要

我们考虑视频摘要问题。给定一段输入原始视频,目标是从中输入视频选取一小部分关键帧,以创建一段更短的摘要视频,最能描述原始视频的内容。当前大多数最先进的视频摘要方法使用监督学习并需要带标签的训练数据。每个训练实例由一段原始输入视频和由人工标注者整理的其真实摘要视频组成。然而,创建此类带标签训练样本非常昂贵且困难。为应对这一局限,我们提出一种从无配对数据中学习视频摘要的新颖形式化方法。我们提出一种方法,使用一组原始视频(VV)和一组摘要视频(SS)来学习生成最优视频摘要,其中 VVSS 之间不存在对应关系。我们认为此类数据更易于收集。我们的模型旨在学习一个映射函数 F:VSF : V \rightarrow S,使得在对抗目标的帮助下,F(V)F(V) 所产生的摘要视频分布与 SS 的分布相似。此外,我们对 F(V)F(V) 施加多样性约束,以确保生成的视频摘要具有视觉多样性。在两个基准数据集上的实验结果表明,我们提出的方法显著优于其他替代方法。

关键词

引用

@article{arxiv.1805.12174,
  title  = {Video Summarization by Learning from Unpaired Data},
  author = {Mrigank Rochan and Yang Wang},
  journal= {arXiv preprint arXiv:1805.12174},
  year   = {2019}
}

备注

Accepted to CVPR 2019