S2DM:用于视频生成的圆形扩散模型
计算机视觉与模式识别
2024-03-25 v2 人工智能
摘要
扩散模型在图像生成方面取得了巨大成功。然而,在利用这一思想进行视频生成时,我们面临在保持视频帧之间一致性和连续性的挑战。这主要是由于缺乏有效的框架来对齐具有所需时间特征的视频帧,同时保持一致的语义和随机特征。在本工作中,我们提出了一种新型圆形扩散模型 (S2DM),其圆形扩散区域由一组从相同噪声点开始的射线形逆扩散过程组成。S2DM 可以生成一组共享相同语义和随机特征的内在相关数据,同时在合适的引导条件下在时间特征上发生变化。我们将 S2DM 应用于视频生成任务,并探索使用光流作为时间条件。我们的实验结果表明,S2DM 在视频生成任务中优于许多现有方法,且无需额外的时序特征建模模块。对于没有明确给出时序条件的文本到视频生成任务,我们提出了两种阶段的生成策略,可将时序特征的生成与语义内容特征的生成解耦。我们展示了,无需额外训练,我们的模型集成了另一个时序条件生成模型后,仍能实现与现有工作相当的性能。我们的结果可在 https://s2dm.github.io/S2DM/ 查看。
引用
@article{arxiv.2403.13408,
title = {S2DM: Sector-Shaped Diffusion Models for Video Generation},
author = {Haoran Lang and Yuxuan Ge and Zheng Tian},
journal= {arXiv preprint arXiv:2403.13408},
year = {2024}
}
备注
17 pages, 6 figures