中文

FlowVid:驾驭不完美的光流以实现一致的视频到视频合成

计算机视觉与模式识别 2024-01-01 v1 多媒体

摘要

扩散模型彻底改变了图像到图像(I2I)合成,并正逐渐渗透到视频领域。然而,视频到视频(V2V)合成的进展一直受到跨视频帧保持时间一致性挑战的阻碍。本文提出了一种一致的 V2V 合成框架,通过联合利用源视频中的空间条件和时间光流线索来实现。与先前严格遵循光流的方法相反,我们的方法在利用其优势的同时处理了光流估计中的不完美性。我们通过从第一帧进行扭曲来编码光流,并将其作为扩散模型中的补充参考。这使得我们的模型能够通过任何流行的 I2I 模型编辑第一帧,然后将编辑传播到后续帧,从而实现视频合成。我们的 V2V 模型 FlowVid 展示了显著的特性:(1) 灵活性:FlowVid 可与现有 I2I 模型无缝协作,促进各种修改,包括风格化、物体替换和局部编辑。(2) 高效性:生成分辨率为 512x512、30 FPS 的 4 秒视频仅需 1.5 分钟,速度分别是 CoDeF、Rerender 和 TokenFlow 的 3.1 倍、7.2 倍和 10.5 倍。(3) 高质量:在用户研究中,我们的 FlowVid 有 45.7% 的时间更受青睐,优于 CoDeF (3.5%)、Rerender (10.2%) 和 TokenFlow (40.4%)。

关键词

引用

@article{arxiv.2312.17681,
  title  = {FlowVid: Taming Imperfect Optical Flows for Consistent Video-to-Video Synthesis},
  author = {Feng Liang and Bichen Wu and Jialiang Wang and Licheng Yu and Kunpeng Li and Yinan Zhao and Ishan Misra and Jia-Bin Huang and Peizhao Zhang and Peter Vajda and Diana Marculescu},
  journal= {arXiv preprint arXiv:2312.17681},
  year   = {2024}
}

备注

Project website: https://jeff-liangf.github.io/projects/flowvid/