中文

JVID:用于视频生成中视觉质量与时序一致性的联合视频-图像扩散

计算机视觉与模式识别 2024-09-30 v2

摘要

我们引入了联合视频-图像扩散模型(JVID),一种生成高质量且时间相干视频的新方法。我们通过整合两个扩散模型来实现这一点:一个在图像上训练的潜在图像扩散模型(LIDM)和一个在视频数据上训练的潜在视频扩散模型(LVDM)。我们的方法在逆向扩散过程中结合这些模型,其中 LIDM 增强图像质量,而 LVDM 确保时间一致性。这种独特的组合使我们能够有效处理视频生成中复杂的时空动态。我们的结果证明了在生成逼真且连贯视频方面的定量和定性改进。

关键词

引用

@article{arxiv.2409.14149,
  title  = {JVID: Joint Video-Image Diffusion for Visual-Quality and Temporal-Consistency in Video Generation},
  author = {Hadrien Reynaud and Matthew Baugh and Mischa Dombrowski and Sarah Cechnicka and Qingjie Meng and Bernhard Kainz},
  journal= {arXiv preprint arXiv:2409.14149},
  year   = {2024}
}