中文

潜视频 Transformer

计算机视觉与模式识别 2020-06-20 v1 机器学习 图像与视频处理

摘要

视频生成任务可表述为给定若干过去帧预测未来视频帧。近期视频生成模型面临计算需求高的问题。部分模型并行训练需要多达 512 个张量处理单元(TPU)。在这项工作中,我们通过在潜空间中对动态进行建模来解决该问题。在将帧变换至潜空间后,我们的模型以自回归方式预测后续帧的潜表示。我们在 BAIR Robot Pushing 和 Kinetics-600 数据集上展示了我们方法的性能。该方法倾向于将模型训练所需资源降至 8 个图形处理单元(GPU),同时保持可比较的生成质量。

关键词

引用

@article{arxiv.2006.10704,
  title  = {Latent Video Transformer},
  author = {Ruslan Rakhimov and Denis Volkhonskiy and Alexey Artemov and Denis Zorin and Evgeny Burnaev},
  journal= {arXiv preprint arXiv:2006.10704},
  year   = {2020}
}