融合你的隐变量:基于多源隐扩散模型的视频编辑
计算机视觉与模式识别
2024-10-10 v2 人工智能
摘要
Latent Diffusion Models (LDMs,隐扩散模型) 以其在图像与视频合成方面的强大能力而著称。然而,相较于文本到图像 (T2I) 编辑,文本到视频 (T2V) 编辑由于缺乏足够的预训练数据、有限的模型可编辑性或高昂的调优成本,而面临时序一致性与结构不佳的问题。为弥补这一差距,我们提出 FLDM (Fused Latent Diffusion Model,融合隐扩散模型),一种通过整合各类 T2I 与 T2V LDMs 实现高质量 T2V 编辑的免训练框架。具体而言,FLDM 利用带有更新计划的超参数,在去噪过程中有效融合图像与视频隐变量。本文首次揭示 T2I 与 T2V LDMs 可在结构与时序一致性方面互补,最终生成高质量视频。值得注意的是,FLDM 可作为一种通用插件,应用于现成的图像与视频 LDMs,以显著提升视频编辑质量。在流行 T2I 与 T2V LDMs 上的大量定量与定性实验表明,FLDM 的编辑质量优于最先进的 T2V 编辑方法。我们的项目代码见 https://github.com/lutianyi0603/fuse_your_latents。
引用
@article{arxiv.2310.16400,
title = {Fuse Your Latents: Video Editing with Multi-source Latent Diffusion Models},
author = {Tianyi Lu and Xing Zhang and Jiaxi Gu and Renjing Pei and Songcen Xu and Xingjun Ma and Hang Xu and Zuxuan Wu},
journal= {arXiv preprint arXiv:2310.16400},
year = {2024}
}