使用字幕的注意力语义视频生成
计算机视觉与模式识别
2017-11-17 v3
摘要
本文提出了一种网络架构,利用字幕进行变长语义视频生成。我们采用了一种新的视频生成视角,允许将字幕与视频帧之间的长期和短期依赖关系相结合,从而以增量方式生成视频。我们的实验证明了我们的网络架构能够区分视频中的物体、动作和交互,并将它们结合起来以生成未见字幕的视频。当被要求为一系列字幕生成视频时,该网络还表现出执行时空风格迁移的能力。我们还表明,网络学习潜在表示的能力使其能够以无监督方式生成视频并执行其他任务,如动作识别。(被 International Conference in Computer Vision (ICCV) 2017 录用)
引用
@article{arxiv.1708.05980,
title = {Attentive Semantic Video Generation using Captions},
author = {Tanya Marwah and Gaurav Mittal and Vineeth N. Balasubramanian},
journal= {arXiv preprint arXiv:1708.05980},
year = {2017}
}