中文

基于空间条件扩散的一致人物图像与视频生成

计算机视觉与模式识别 2024-12-20 v1

摘要

一致的人物图像和视频合成旨在生成具有新姿态的图像或视频,同时保持与给定参考图像的外观一致性,这对于低成本的视觉内容创建至关重要。基于扩散模型的近期进展通常依赖于用于参考外观特征提取和目标视觉生成的独立网络,导致参考与目标之间存在显著的领域差距。本文将该任务定义为空间条件修图问题,即将目标图像修图以保持与参考图像的外观一致性。这种方法使参考特征能够在统一的去噪网络中引导姿态合规目标的生成,从而缓解领域差距。此外,为更好地保持参考外观信息,我们采用因果特征交互框架,即参考特征只能查询自身,而目标特征可以查询来自参考和目标的外观信息。为进一步提高计算效率和灵活性,在实际实现中,我们将空间条件生成过程分解为两个阶段:参考外观提取和条件目标生成。两个阶段共享单个去噪网络,仅在自注意力层之间进行交互。该方法确保对生成的人物图像和视频外观具有灵活的控制。通过在人类视频数据上微调现有的基础扩散模型,我们的方法在无需额外逐实例微调的情况下,演示出对未见的人类身份和姿态具有强大的泛化能力。实验结果验证了我们方法的有效性,表明其在一致的人物图像和视频合成方面与现有方法性能相当。

关键词

引用

@article{arxiv.2412.14531,
  title  = {Consistent Human Image and Video Generation with Spatially Conditioned Diffusion},
  author = {Mingdeng Cao and Chong Mou and Ziyang Yuan and Xintao Wang and Zhaoyang Zhang and Ying Shan and Yinqiang Zheng},
  journal= {arXiv preprint arXiv:2412.14531},
  year   = {2024}
}

备注

Project page: https://github.com/ljzycmd/SCD