中文

跟随画布:基于扩散模型的高分辨率视频插画

计算机视觉与模式识别 2024-09-04 v1

摘要

本文探讨了高分辨率视频插画的大规模内容生成问题。我们指出现有方法在大范围插画视频时面临的常见问题:生成内容质量低且受限于 GPU 内存。为此,我们提出了一种称为 \textit{Follow-Your-Canvas} 的扩散方法。其核心设计包括:首先,与常见的单次插画不同,我们将任务分布到空间窗口中并无缝拼接。这使得我们可以在不受 GPU 内存限制的情况下插画任意大小和分辨率的视频。其次,将源视频及其相对位置关系注入到每个窗口的生成过程中。这使得每个窗口中生成的空间布局与源视频保持和谐。凭借这两个设计,我们能够在保持空间和时间一致性的前提下,生成富有内容的高分辨率插画视频。Follow-Your-Canvas 在大规模视频插画方面表现突出,例如从 512X512 插画至 1152X2048(放大 9 倍),并产生高质量、审美观好的结果。在各种分辨率和比例设置下实现最佳量化结果。代码已发布于 https://github.com/mayuelala/FollowYourCanvas

关键词

引用

@article{arxiv.2409.01055,
  title  = {Follow-Your-Canvas: Higher-Resolution Video Outpainting with Extensive Content Generation},
  author = {Qihua Chen and Yue Ma and Hongfa Wang and Junkun Yuan and Wenzhe Zhao and Qi Tian and Hongmei Wang and Shaobo Min and Qifeng Chen and Wei Liu},
  journal= {arXiv preprint arXiv:2409.01055},
  year   = {2024}
}

备注

Github: https://github.com/mayuelala/FollowYourCanvas Page: https://follow-your-canvas.github.io/