中文

无需调参的长视频生成:全局-局部协同扩散

计算机视觉与模式识别 2025-01-13 v1

摘要

生成高保真、连贯的长视频是一个备受追求的目标。尽管最近的视频扩散模型显示出有希望的潜力,但它们仍然面临时空不一致和高计算资源需求的问题。我们提出了GLC-Diffusion,一种无需调参的长视频生成方法。它通过全局-局部协同去噪建立去噪轨迹来建模长视频去噪过程,以确保整体内容一致性和帧间时间连贯性。此外,我们引入了一种噪声重初始化策略,该策略结合了局部噪声混洗和频率融合,以提高全局内容一致性和视觉多样性。进一步,我们提出了一个视频运动一致性细化(VMCR)模块,该模块计算像素级和频率级损失的梯度,以增强视觉一致性和时间平滑性。大量实验,包括对不同长度视频(例如,3倍和6倍更长)的定量和定性评估,表明我们的方法能够有效地与现有视频扩散模型集成,生成连贯、高保真的长视频,优于先前的方法。

关键词

引用

@article{arxiv.2501.05484,
  title  = {Tuning-Free Long Video Generation via Global-Local Collaborative Diffusion},
  author = {Yongjia Ma and Junlin Chen and Donglin Di and Qi Xie and Lei Fan and Wei Chen and Xiaofei Gou and Na Zhao and Xun Yang},
  journal= {arXiv preprint arXiv:2501.05484},
  year   = {2025}
}