基于时间无关 VQGAN 与时间敏感 Transformer 的长视频生成
计算机视觉与模式识别
2022-09-27 v4 人工智能
摘要
视频被创造用来表达情感、交换信息和分享体验。视频合成长期以来一直吸引着研究者。尽管视觉合成技术的进步推动了快速发展,但现有研究大多侧重于提升单帧质量及其过渡效果,而在生成长视频方面进展甚微。本文提出一种基于 3D-VQGAN 和 Transformer 的方法,可生成包含数千帧的视频。我们的评估表明,该模型在 UCF-101、Sky Time-lapse 和 Taichi-HD 等标准基准数据集的 16 帧视频片段上训练后,能够生成多样化、连贯且高质量的长视频。我们还展示了该方法的条件扩展,通过结合文本和音频的时间信息来生成有意义的长视频。视频和代码可在 https://songweige.github.io/projects/tats/index.html 获取。
引用
@article{arxiv.2204.03638,
title = {Long Video Generation with Time-Agnostic VQGAN and Time-Sensitive Transformer},
author = {Songwei Ge and Thomas Hayes and Harry Yang and Xi Yin and Guan Pang and David Jacobs and Jia-Bin Huang and Devi Parikh},
journal= {arXiv preprint arXiv:2204.03638},
year = {2022}
}
备注
In ECCV 2022