中文

基于变换的大规模数据对抗式视频预测

计算机视觉与模式识别 2021-11-18 v3 机器学习

摘要

对抗式生成建模最近的突破已催生出能够生成高质量视频样本的模型,即使在大规模且复杂的真实世界视频数据集上也是如此。在这项工作中,我们聚焦于视频预测任务,即给定从视频中提取的帧序列,目标是生成合理的未来序列。我们首先通过系统性地实证研究判别器分解并提出一种比先前方法收敛更快、性能更高的架构,从而改进了当前最优水平。接着我们分析了生成器中的循环单元,并提出了一种新颖的循环单元,它根据预测的类运动特征变换其过去的隐藏状态,并对其进行细化以处理去遮挡、场景变化及其他复杂行为。我们表明该循环单元一致地优于先前的设计。我们的最终模型带来了当前最优性能的巨大飞跃,在大规模 Kinetics-600 数据集上获得了 25.7 的测试集 Frechet Video Distance,而此前为 69.2。

关键词

引用

@article{arxiv.2003.04035,
  title  = {Transformation-based Adversarial Video Prediction on Large-Scale Data},
  author = {Pauline Luc and Aidan Clark and Sander Dieleman and Diego de Las Casas and Yotam Doron and Albin Cassirer and Karen Simonyan},
  journal= {arXiv preprint arXiv:2003.04035},
  year   = {2021}
}