中文

时钟式变分自编码器

计算机视觉与模式识别 2021-02-23 v2 人工智能 机器学习

摘要

深度学习已使算法能够生成逼真的图像。然而,准确预测长视频序列需要理解长期依赖关系,这仍是一个开放挑战。尽管现有的视频预测模型在生成清晰图像方面取得成功,但它们往往无法准确预测遥远的未来。我们提出了时钟式 VAE(CW-VAE),一种利用分层潜在序列的视频预测模型,其中较高层以较慢的间隔“滴答”。我们在 4 个多样化的视频预测数据集上展示了分层潜在变量与时间抽象的优势,这些数据集的序列长达 1000 帧,CW-VAE 优于顶尖的视频预测模型。此外,我们提出了一个用于长期视频预测的 Minecraft 基准。我们进行了若干实验以深入理解 CW-VAE,并确认较慢的层学会表示视频中变化更慢的物体,而较快的层学会表示更快的物体。

关键词

引用

@article{arxiv.2102.09532,
  title  = {Clockwork Variational Autoencoders},
  author = {Vaibhav Saxena and Jimmy Ba and Danijar Hafner},
  journal= {arXiv preprint arXiv:2102.09532},
  year   = {2021}
}

备注

17 pages, 12 figures, 4 tables