中文

HARP:基于高保真图像生成器的自回归隐空间视频预测

计算机视觉与模式识别 2022-09-16 v1

摘要

视频预测是一个重要却具挑战性的问题,背负着生成未来帧与学习环境动态的任务。近来,自回归隐空间视频模型已被证明是强大的视频预测工具,其将视频预测分为两个子问题:预训练图像生成器模型,随后在图像生成器的隐空间中学习自回归预测模型。然而,成功生成高保真与高分辨率视频尚待实现。本工作中,我们研究如何以对现有模型最小改动训练一个能预测高保真未来帧的自回归隐空间视频预测模型,并生成高分辨率(256x256)视频。具体而言,我们通过采用高保真图像生成器(VQ-GAN)与因果 Transformer 模型来扩展先前模型,并引入 top-k 采样与数据增强的附加技术以进一步提升视频预测质量。尽管简单,所提方法在标准视频预测基准上以更少参数取得与最先进方法相竞争的性能,并能在复杂大规模数据集上实现高分辨率视频预测。视频见 https://sites.google.com/view/harp-videos/home。

关键词

引用

@article{arxiv.2209.07143,
  title  = {HARP: Autoregressive Latent Video Prediction with High-Fidelity Image Generator},
  author = {Younggyo Seo and Kimin Lee and Fangchen Liu and Stephen James and Pieter Abbeel},
  journal= {arXiv preprint arXiv:2209.07143},
  year   = {2022}
}

备注

Extended draft of the paper accepted to ICIP 2022 conference