中文

SSG-DiT:一种空间信号引导的可控视频生成框架

计算机视觉与模式识别 2025-08-26 v1 人工智能

摘要

可控视频生成旨在合成与用户提供的条件(如文本描述和初始图像)精确对齐的视频内容。然而,该领域存在一个重大挑战:现有模型往往难以保持强大的语义一致性,经常生成偏离提示中细微细节的视频。为了解决这一问题,我们提出了 SSG-DiT(空间信号引导扩散变换器),一种用于高保真可控视频生成的新型高效框架。我们的方法引入了一种解耦的两阶段过程。第一阶段——空间信号提示——通过利用预训练多模态模型的丰富内部表示,生成具有空间感知能力的视觉提示。该提示与原始文本结合,形成联合条件,然后通过我们的轻量级和参数高效的 SSG-Adapter 注入到冻结的视频 DiT 主干网络中。这种独特的设计,采用双分支注意力机制,使模型能够同时利用其强大的生成先验,同时被外部空间信号精确引导。大量实验表明,SSG-DiT 达到了最先进的性能,在 VBench 基准测试的多个关键指标上超越了现有模型,特别是在空间关系控制和整体一致性方面。

关键词

引用

@article{arxiv.2508.17062,
  title  = {SSG-Dit: A Spatial Signal Guided Framework for Controllable Video Generation},
  author = {Peng Hu and Yu Gu and Liang Luo and Fuji Ren},
  journal= {arXiv preprint arXiv:2508.17062},
  year   = {2025}
}