中文

DisenStudio:具有解耦空间控制的定制多主体文本到视频生成

计算机视觉与模式识别 2024-05-22 v1

摘要

在视频中生成定制内容近期受到越来越多的关注。然而,现有工作主要集中在针对单一主体的定制 text-to-video 生成上,当视频需要包含多个主体时,会出现主体缺失和属性绑定问题。此外,现有模型难以将期望的动作分配给相应的主体(动作绑定问题),无法实现令人满意的多主体生成性能。为了解决这些问题,本文提出了 DisenStudio,这是一个新颖的框架,能够在给定每个主体少量图像的情况下,为定制的多个主体生成文本引导的视频。具体而言,DisenStudio 通过我们提出的空间解耦交叉注意力机制增强了预训练的基于扩散的 text-to-video 模型,以将每个主体与期望的动作相关联。然后,通过提出的保持运动的解耦微调对该模型进行多主体定制,这涉及三种微调策略:多主体共现微调、掩蔽单主体微调和多主体保持运动微调。前两种策略保证了主体的出现并保留了其视觉属性,第三种策略帮助模型在静态图像上微调时保持时序运动生成能力。我们进行了大量实验,证明我们提出的 DisenStudio 在各项指标上均显著优于现有方法。此外,我们展示了 DisenStudio 可作为各种可控生成应用的有力工具。

关键词

引用

@article{arxiv.2405.12796,
  title  = {DisenStudio: Customized Multi-subject Text-to-Video Generation with Disentangled Spatial Control},
  author = {Hong Chen and Xin Wang and Yipeng Zhang and Yuwei Zhou and Zeyang Zhang and Siao Tang and Wenwu Zhu},
  journal= {arXiv preprint arXiv:2405.12796},
  year   = {2024}
}