迈向精确的视频生成模型:一种新度量指标与挑战
计算机视觉与模式识别
2019-03-28 v2 人工智能
机器学习
神经与进化计算
机器学习
摘要
深度生成模型的最新进展使得合成高质量图像取得了显著进步。在图像处理和表示学习中成功应用之后,一个重要下一步是考虑视频。学习视频的生成模型是一项更困难的任务,除了对象的视觉呈现外,还需要模型捕捉场景的时间动态。尽管近期在构建视频生成模型的尝试取得了一定成功,但当前进展受到以下阻碍:(1) 缺乏考虑视觉质量、时间连贯性和样本多样性的定性度量指标;(2) 纯合成视频数据集与复杂真实世界数据集之间在复杂度上存在巨大差距。为此,我们提出了 Fréchet Video Distance (FVD),一种用于视频生成模型的新指标,以及 StarCraft 2 Videos (SCV),一个来自自定义星际争霸2游戏场景的玩法基准,其挑战了当前视频生成模型的能力。我们贡献了一项大规模人类研究,证实了 FVD 与生成视频的定性人类判断具有良好的相关性,并提供了在 SCV 上的初步基准结果。
引用
@article{arxiv.1812.01717,
title = {Towards Accurate Generative Models of Video: A New Metric & Challenges},
author = {Thomas Unterthiner and Sjoerd van Steenkiste and Karol Kurach and Raphael Marinier and Marcin Michalski and Sylvain Gelly},
journal= {arXiv preprint arXiv:1812.01717},
year = {2019}
}