中文

Video ControlNet:基于条件图像扩散模型实现时间一致的合成到真实视频翻译

计算机视觉与模式识别 2023-05-31 v1

摘要

在本研究中,我们提出了一种高效且有效的方法,用于在不同长度视频中实现时间一致的合成到真实视频翻译。我们的方法利用现成的条件图像扩散模型,使我们能够并行执行多次合成到真实图像生成。通过利用合成视频中可用的光流信息,我们的方法在跨帧对应像素间无缝强制时间一致性。这通过联合噪声优化实现,有效最小化空间和时间差异。据我们所知,我们提出的方法是首个使用条件图像扩散模型完成多样且时间一致的合成到真实视频翻译的方法。此外,我们的方法不需要对扩散模型进行任何训练或微调。在多个合成到真实视频翻译基准上进行的广泛实验从定量和定性上证明了我们方法的有效性。最后,我们表明我们的方法在时间一致性和视觉质量方面均优于其他基线方法。

关键词

引用

@article{arxiv.2305.19193,
  title  = {Video ControlNet: Towards Temporally Consistent Synthetic-to-Real Video Translation Using Conditional Image Diffusion Models},
  author = {Ernie Chu and Shuo-Yen Lin and Jun-Cheng Chen},
  journal= {arXiv preprint arXiv:2305.19193},
  year   = {2023}
}