中文

用于文本到视频生成的双流扩散网络

计算机视觉与模式识别 2024-01-02 v3

摘要

随着扩散模型的出现,近期文本到视频生成引起了越来越多的关注。但其中一个重要瓶颈是生成的视频往往带有一些闪烁和伪影。在本工作中,我们提出一种双流扩散网络(DSDN)以改善生成视频中内容变化的连贯性。具体而言,所设计的两条扩散流——视频内容分支与运动分支——不仅可在各自私有空间中独立运行以产生个性化的视频变化及内容,还能通过我们利用设计的跨Transformer交互模块在内容与运动域之间良好对齐,这将有益于生成视频的平滑性。此外,我们还引入了运动分解器与合成器以方便对视频运动进行操作。定性与定量实验表明,我们的方法能生成连贯性惊人且闪烁更少的视频。

关键词

引用

@article{arxiv.2308.08316,
  title  = {Dual-Stream Diffusion Net for Text-to-Video Generation},
  author = {Binhui Liu and Xin Liu and Anbo Dai and Zhiyong Zeng and Dan Wang and Zhen Cui and Jian Yang},
  journal= {arXiv preprint arXiv:2308.08316},
  year   = {2024}
}

备注

8pages, 7 figures