Sync-DRAW:基于深度循环注意力架构的自动视频生成
计算机视觉与模式识别
2017-10-24 v4
摘要
本文提出一种新颖的视频生成方法,称为同步深度循环注意力写手(Sync-DRAW)。Sync-DRAW 还能执行文本到视频的生成,据我们所知,这使其成为同类方法中的首创。它以新颖的方式结合了变分自编码器(VAE)与循环注意力机制,以创建随时间逐步形成的、具有时间依赖性的帧序列。Sync-DRAW 中的循环注意力机制同步关注视频的每一帧,而 VAE 则在全局层面学习整个视频的潜在分布。我们在 Bouncing MNIST、KTH 和 UCF-101 上的实验表明,Sync-DRAW 能高效学习视频的空间与时间信息,生成具有高结构完整性的帧,并能根据这些数据集上的简单字幕生成视频。(已被 ACM-Multimedia 2017 接收为口头报告论文)
引用
@article{arxiv.1611.10314,
title = {Sync-DRAW: Automatic Video Generation using Deep Recurrent Attentive Architectures},
author = {Gaurav Mittal and Tanya Marwah and Vineeth N. Balasubramanian},
journal= {arXiv preprint arXiv:1611.10314},
year = {2017}
}