ConsistI2V:增强图像到视频生成的视觉一致性
计算机视觉与模式识别
2024-07-02 v2
摘要
图像到视频(I2V)生成旨在使用初始帧(连同文本提示)来创建视频序列。I2V 生成中的一个重大挑战是在整个视频中保持视觉一致性:现有方法通常难以保留第一帧中主体、背景和风格的完整性,也难以确保视频叙事中流畅且合乎逻辑的进展。为缓解这些问题,我们提出了 ConsistI2V,一种基于扩散的方法,用于增强 I2V 生成的视觉一致性。具体而言,我们引入了(1)对第一帧的时空注意力以保持空间和运动一致性,(2)从第一帧的低频带进行噪声初始化以增强布局一致性。这两种方法使 ConsistI2V 能够生成高度一致的视频。我们还将所提出的方法进行了扩展,展示了它们在改善自回归长视频生成和摄像机运动控制中一致性的潜力。为了验证我们方法的有效性,我们提出了 I2V-Bench,一个用于 I2V 生成的综合评估基准。我们的自动和人工评估结果证明了 ConsistI2V 优于现有方法。
引用
@article{arxiv.2402.04324,
title = {ConsistI2V: Enhancing Visual Consistency for Image-to-Video Generation},
author = {Weiming Ren and Huan Yang and Ge Zhang and Cong Wei and Xinrun Du and Wenhao Huang and Wenhu Chen},
journal= {arXiv preprint arXiv:2402.04324},
year = {2024}
}
备注
Project Page: https://tiger-ai-lab.github.io/ConsistI2V/