中文

图像到视频扩散模型中的条件图像泄漏诊断与解决方案

计算机视觉与模式识别 2024-11-07 v3 人工智能

摘要

扩散模型在图像到视频生成方面取得了显著进展。然而,本文发现这些模型倾向于生成运动较少的视频。我们将其归因于一种称为条件图像泄漏(conditional image leakage)的现象,即图像到视频扩散模型(I2V-DMs)在较大时间步长时过度依赖条件图像。我们从推理和训练两个方面解决此挑战。首先,我们提议从较早的时间步开始生成,以避免 I2V-DMs 在不可靠的大时间步长的问题,同时提出一种具有最优解析表达的初始噪声分布(Analytic-Init),通过最小化其与实际边际分布之间的 KL 散度来弥合训练-推理之间的差距。其次,我们设计一种基于时间的噪声分布(TimeNoise)用于条件图像,在训练期间对较大时间步长应用更高的噪声水平,以干扰条件图像并减少模型对其的依赖。我们在收集的开放领域图像基准和 UCF101 数据集上对各种 I2V-DMs 进行了验证。广泛的结果表明,我们的方法在保持图像对齐和时间一致性的同时,生成的运动分数更高、误差更低,从而实现了优异的整体性能,使运动控制更加准确。项目页面:\url{https://cond-image-leak.github.io/}。

关键词

引用

@article{arxiv.2406.15735,
  title  = {Identifying and Solving Conditional Image Leakage in Image-to-Video Diffusion Model},
  author = {Min Zhao and Hongzhou Zhu and Chendong Xiang and Kaiwen Zheng and Chongxuan Li and Jun Zhu},
  journal= {arXiv preprint arXiv:2406.15735},
  year   = {2024}
}

备注

NeurIPS 2024. Project page: https://cond-image-leak.github.io/