MeDM:以时间对应引导介导图像扩散模型用于视频到视频翻译
计算机视觉与模式识别
2023-12-21 v3
摘要
本研究引入了一种高效且有效的方法 MeDM,该方法利用预训练的图像扩散模型进行具有一致时间流的视频到视频翻译。所提出的框架可根据场景位置信息(如法线 G-buffer)渲染视频,或对真实场景捕获的视频进行文本引导编辑。我们采用显式光流构建一种实用编码,该编码对生成帧施加物理约束并介导独立的逐帧分数。借助此编码,在生成视频中保持时间一致性可被框定为具有闭式解的最优化问题。为确保与 Stable Diffusion 兼容,我们还提出了一种修改潜扩散模型中观测空间分数的变通方案。值得注意的是,MeDM 不需要对扩散模型进行微调或测试时优化。通过在多个基准上的广泛定性、定量和主观实验,本研究证明了所提方法的有效性和优越性。我们的项目页面位于 https://medm2023.github.io
引用
@article{arxiv.2308.10079,
title = {MeDM: Mediating Image Diffusion Models for Video-to-Video Translation with Temporal Correspondence Guidance},
author = {Ernie Chu and Tzuhsuan Huang and Shuo-Yen Lin and Jun-Cheng Chen},
journal= {arXiv preprint arXiv:2308.10079},
year = {2023}
}
备注
Accepted as a conference paper in AAAI 2024. Project page: https://medm2023.github.io