免调优噪声校正实现高保真图像到视频生成
计算机视觉与模式识别
2024-03-06 v1
摘要
图像到视频(I2V)生成任务在开放域中保持高保真度方面总是面临困难。传统的图像动画技术主要关注特定领域,如人脸或人体姿态,使其难以推广到开放域。最近几种基于扩散模型的I2V框架可以为开放域图像生成动态内容,但无法保持保真度。我们发现低保真度的两个主要因素是图像细节的丢失和去噪过程中的噪声预测偏差。为此,我们提出了一种有效的方法,可以应用于主流视频扩散模型。该方法基于补充更精确的图像信息和噪声校正来实现高保真度。具体来说,给定指定图像,我们的方法首先向输入图像潜在表示添加噪声以保留更多细节,然后通过适当的校正对噪声潜在表示进行去噪以减轻噪声预测偏差。我们的方法无需调优且即插即用。实验结果证明了我们的方法在提高生成视频保真度方面的有效性。更多图像到视频生成结果,请参考项目网站:https://noise-rectification.github.io。
引用
@article{arxiv.2403.02827,
title = {Tuning-Free Noise Rectification for High Fidelity Image-to-Video Generation},
author = {Weijie Li and Litong Gong and Yiran Zhu and Fanda Fan and Biao Wang and Tiezheng Ge and Bo Zheng},
journal= {arXiv preprint arXiv:2403.02827},
year = {2024}
}