中文

SparseCtrl:为文本到视频扩散模型添加稀疏控制

计算机视觉与模式识别 2023-11-29 v1

摘要

文本到视频(T2V),即根据给定文本提示生成视频,近年来取得了显著进展。然而,仅依赖文本提示常因空间不确定性导致帧构图模糊。研究界因此利用稠密结构信号(如逐帧深度/边缘序列)来增强可控性,其采集相应增加了推理负担。在本工作中,我们提出 SparseCtrl,以时序稀疏信号实现灵活的结构控制,仅需一个或少数几个输入,如图 1 所示。它引入额外的条件编码器来处理这些稀疏信号,同时保持预训练 T2V 模型不变。所提方法兼容草图、深度图与 RGB 图像等多种模态,为视频生成提供更实用的控制,并推动故事板、深度渲染、关键帧动画与插值等应用。大量实验证明了 SparseCtrl 在原始与个性化 T2V 生成器上的泛化能力。代码与模型将公开于 https://guoyww.github.io/projects/SparseCtrl 。

关键词

引用

@article{arxiv.2311.16933,
  title  = {SparseCtrl: Adding Sparse Controls to Text-to-Video Diffusion Models},
  author = {Yuwei Guo and Ceyuan Yang and Anyi Rao and Maneesh Agrawala and Dahua Lin and Bo Dai},
  journal= {arXiv preprint arXiv:2311.16933},
  year   = {2023}
}

备注

Project page: https://guoyww.github.io/projects/SparseCtrl