中文

具有可证明解耦的可控视频生成

计算机视觉与模式识别 2025-10-07 v3 人工智能 机器学习

摘要

尽管在生成高质量和一致性视频方面取得了最新进展,可控视频生成仍然是一个重大挑战。大多数现有的控制视频生成方法将视频视为一个整体,忽略了复杂的细粒度时空关系,这限制了控制的精度和效率。在本文中,我们提出了可控视频生成对抗网络 (CoVoGAN) 来解耦视频概念,从而促进对各个概念的高效且独立的控制。具体来说,遵循最小变化原则,我们首先解耦静态和动态潜变量。然后,我们利用充分变化性质来实现动态潜变量的分量级可识别性,从而实现视频生成的解耦控制。为了建立理论基础,我们提供了严格的分析,证明了我们方法的可识别性。基于这些理论见解,我们设计了一个时间转换模块来解耦潜在动态。为了强制最小变化原则和充分变化性质,我们最小化了潜在动态变量的维度,并施加了时间条件独立性。为了验证我们的方法,我们将此模块作为 GAN 的即插即用组件集成。在各种视频生成基准上的大量定性和定量实验表明,我们的方法在多样化的现实世界场景中显著提高了生成质量和可控性。

关键词

引用

@article{arxiv.2502.02690,
  title  = {Controllable Video Generation with Provable Disentanglement},
  author = {Yifan Shen and Peiyuan Zhu and Zijian Li and Shaoan Xie and Namrata Deka and Zongfang Liu and Zeyu Tang and Guangyi Chen and Kun Zhang},
  journal= {arXiv preprint arXiv:2502.02690},
  year   = {2025}
}