中文

FlashI2V:基于傅里叶引导的潜在位移防止图像到视频生成中的条件图像泄漏

计算机视觉与模式识别 2025-11-17 v2

摘要

在图像到视频(I2V)生成中,使用输入图像作为第一帧条件创建视频。现有I2V方法将条件图像的完整信息与带噪潜在向量拼接以实现高保真度。然而,这些方法中的去噪器倾向于“shortcut”条件图像,导致条件图像泄漏,引发运动缓慢和颜色不一致等性能问题。本文进一步阐明,条件图像泄漏导致对领域内数据的过拟合,并降低在域外场景中的性能。我们提出Fourier-Guided Latent Shifting I2V,称为FlashI2V,防止条件图像泄漏。具体而言,FlashI2V包括:(1)潜在位移。通过从带噪潜在向量中减去条件图像信息,修改流匹配的源分布和目标分布,从而隐式地融合条件信息。(2)傅里叶引导。使用傅里叶变换获得的高频幅度特征以加快收敛速度,并实现对生成视频细节水平的调整。实验结果表明,我们的方法有效克服了条件图像泄漏,在各种I2V范式中实现了最佳的泛化性和域外数据性能。FlashI2V仅需13亿参数,即可在Vbench-I2V上实现53.01的动态程度评分,超越CogVideoX1.5-5B-I2V和Wan2.1-I2V-14B-480P。项目页面:https://pku-yuangroup.github.io/FlashI2V/

关键词

引用

@article{arxiv.2509.25187,
  title  = {FlashI2V: Fourier-Guided Latent Shifting Prevents Conditional Image Leakage in Image-to-Video Generation},
  author = {Yunyang Ge and Xinhua Cheng and Chengshu Zhao and Xianyi He and Shenghai Yuan and Bin Lin and Bin Zhu and Li Yuan},
  journal= {arXiv preprint arXiv:2509.25187},
  year   = {2025}
}