中文

StoryDiffusion:用于长范围图像和视频生成的一致自注意力

计算机视觉与模式识别 2024-05-03 v1

摘要

对于最近的基于扩散的生成模型,保持一系列生成图像之间的一致内容,尤其是包含主体和复杂细节的图像, presents a significant challenge。本文提出了一种新的自注意力计算方式,称为一致自注意力(Consistent Self-Attention),显著提升了生成图像之间的一致性,并以零样本方式增强了流行的预训练基于扩散的文本到图像模型。为了将该方法扩展到长程视频生成,我们进一步引入了一种新的语义空间时间运动预测模块,称为语义运动预测器(Semantic Motion Predictor)。该模块被训练用于估计两个提供图像之间的运动条件。该模块将一系列生成的图像转换为具有平滑过渡和一致主体的视频,特别是在长视频生成的背景下,比仅基于潜在空间的模块要稳定得多。通过合并这两个新组件,我们的框架称为StoryDiffusion,可以用一致的图像或视频描述基于文本的故事,涵盖丰富的内容 variety。提出的StoryDiffusion包含了在图像和视频呈现方面的 pioneering 探索,我们希望能够激发更多关于架构修改方面的研究。我们的代码已公开发布于 https://github.com/HVision-NKU/StoryDiffusion。

关键词

引用

@article{arxiv.2405.01434,
  title  = {StoryDiffusion: Consistent Self-Attention for Long-Range Image and Video Generation},
  author = {Yupeng Zhou and Daquan Zhou and Ming-Ming Cheng and Jiashi Feng and Qibin Hou},
  journal= {arXiv preprint arXiv:2405.01434},
  year   = {2024}
}