Rerender A Video:零样本文本引导的视频到视频翻译
计算机视觉与模式识别
2023-09-19 v2
摘要
大型文本到图像扩散模型已展现出生成高质量图像的惊人能力。然而,当将这些模型应用于视频领域时,确保视频帧间的时间一致性仍是一项艰巨挑战。本文提出一种新颖的零样本文本引导视频到视频翻译框架,将图像模型适配于视频。该框架包括两部分:关键帧翻译与完整视频翻译。第一部分使用适配的扩散模型生成关键帧,并施加分层跨帧约束以强制形状、纹理和颜色上的连贯性。第二部分通过时间感知块匹配与帧混合将关键帧传播至其他帧。我们的框架以低成本(无需重新训练或优化)实现了全局风格与局部纹理的时间一致性。该适配与现有图像扩散技术兼容,使我们的框架能利用它们,例如使用 LoRA 定制特定主体,以及通过 ControlNet 引入额外空间引导。大量实验结果证明了我们所提框架在渲染高质量且时间连贯的视频方面优于现有方法。
引用
@article{arxiv.2306.07954,
title = {Rerender A Video: Zero-Shot Text-Guided Video-to-Video Translation},
author = {Shuai Yang and Yifan Zhou and Ziwei Liu and Chen Change Loy},
journal= {arXiv preprint arXiv:2306.07954},
year = {2023}
}
备注
Accepted to SIGGRAPH Asia 2023. Project page: https://www.mmlab-ntu.com/project/rerender/