VideoElevator:利用多功能文本到图像扩散模型提升视频生成质量
计算机视觉与模式识别
2024-03-11 v1
摘要
文本到图像扩散模型(T2I)在创建逼真和美观的图像方面展现了前所未有的能力。相反,文本到视频扩散模型(T2V)在帧质量和文本对齐方面仍然远远落后,这是由于训练视频的质量和数量不足所致。在本文中,我们介绍了 VideoElevator,这是一种无需训练且即插即用的方法,利用 T2I 的卓越能力提升 T2V 的性能。与传统的 T2V 采样(即时间和空间建模)不同,VideoElevator 显式地将每个采样步骤分解为时间运动细化和空间质量提升。具体而言,时间运动细化使用封装的 T2V 来增强时间一致性,随后反演到 T2I 所需的噪声分布。然后,空间质量提升利用膨胀的 T2I 直接预测噪声较少的潜在表示,添加更多照片级真实的细节。我们在各种 T2V 和 T2I 组合下的广泛提示词上进行了实验。结果表明,VideoElevator 不仅利用基础 T2I 提高了 T2V 基线的性能,还促进了利用个性化 T2I 进行风格化视频合成。我们的代码可在 https://github.com/YBYBZhang/VideoElevator 获取。
引用
@article{arxiv.2403.05438,
title = {VideoElevator: Elevating Video Generation Quality with Versatile Text-to-Image Diffusion Models},
author = {Yabo Zhang and Yuxiang Wei and Xianhui Lin and Zheng Hui and Peiran Ren and Xuansong Xie and Xiangyang Ji and Wangmeng Zuo},
journal= {arXiv preprint arXiv:2403.05438},
year = {2024}
}
备注
Project page: https://videoelevator.github.io Code: https://github.com/YBYBZhang/VideoElevator