中文

FrameBridge:通过桥接模型改进图像到视频生成

计算机视觉与模式识别 2025-06-17 v2 人工智能 机器学习

摘要

扩散模型在图像到视频(I2V)生成方面取得了显著进展,但其噪声到数据生成过程与该任务本质上不匹配,可能导致生成质量次优。本文提出 FrameBridge。通过基于数据到数据生成过程建模帧到帧的生成过程,我们能够充分利用给定图像中包含的信息,并提高生成过程与 I2V 任务之间的一致性。此外,我们提出了两种新技术针对训练 I2V 模型的两种流行设置。首先,我们提出了 SNR-Aligned Fine-tuning(SAF),首次尝试对扩散模型进行微调以适应桥接模型,从而允许我们利用预先训练的基于扩散的文本到视频(T2V)模型。其次,我们提出了神经先验,进一步提高了 FrameBridge 在从头训练时的生成质量。在 WebVid-2M 和 UCF-101 上的实验表明,FrameBridge 在质量上优于扩散模型对应方法(零样本 FVD 95 与 MSR-VTT 上 192,非零样本 FVD 122 与 UCF-101 上 171),以及我们提出的 SAF 和神经先验对基于桥接的 I2V 模型的优势。项目页面:https://framebridge-icml.github.io/。

关键词

引用

@article{arxiv.2410.15371,
  title  = {FrameBridge: Improving Image-to-Video Generation with Bridge Models},
  author = {Yuji Wang and Zehua Chen and Xiaoyu Chen and Yixiang Wei and Jun Zhu and Jianfei Chen},
  journal= {arXiv preprint arXiv:2410.15371},
  year   = {2025}
}