中文

Mobius:基于潜空间位移的文本到无缝循环视频生成

计算机视觉与模式识别 2025-02-28 v1

摘要

我们提出Mobius,一种从文本描述直接生成无缝循环视频的新方法,无需任何用户标注,从而为多媒体演示创建新的视觉材料。我们将预先训练的视频潜扩散模型用于从文本提示生成循环视频,无需任何训练。在推理过程中,我们首先构建一个潜空间循环,将视频的起始噪声和结束噪声相连。鉴于视频扩散模型的上下文可以维持时间一致性,我们通过在每一步中逐渐将第一帧的潜空间位移到末端来进行多帧潜去噪。因此,在每一步中去噪上下文会发生变化,但在整个推理过程中保持一致。此外,我们方法中的潜空间循环长度可以是任意长度。这将我们的潜位移方法扩展到视频扩散模型上下文范围之外的无缝循环视频生成。与以往的电影画作不同,本方法不需要图像作为外观,从而限制生成结果的运动。相反,我们的方法可以产生更动态的运动和更好的视觉质量。我们进行了多项实验和比较,以验证所提出方法的有效性,证明其在不同情景下的有效性。所有代码将公开提供。

关键词

引用

@article{arxiv.2502.20307,
  title  = {Mobius: Text to Seamless Looping Video Generation via Latent Shift},
  author = {Xiuli Bi and Jianfei Yuan and Bo Liu and Yong Zhang and Xiaodong Cun and Chi-Man Pun and Bin Xiao},
  journal= {arXiv preprint arXiv:2502.20307},
  year   = {2025}
}

备注

Project page: https://mobius-diffusion.github.io/ ; GitHub repository: https://github.com/YisuiTT/Mobius