中文

LEO:用于人体视频合成的生成式潜空间图像动画器

计算机视觉与模式识别 2024-11-13 v3

摘要

时空一致性是合成高质量视频的主要挑战,尤其在合成包含丰富全局与局部形变的人体视频时。为解决该挑战,先前方法在生成过程中借助不同特征来表示外观与运动。然而,在缺乏严格机制保证此种解耦的情况下,将运动从外观中分离一直十分困难,导致破坏时空一致性的空间畸变与时间抖动。受此启发,我们提出 LEO,一种强调时空一致性的人体视频合成新框架。我们的核心思想是在生成过程中将运动表示为流图序列,其天然将运动与外观隔离。我们通过基于流的图片动画器与潜运动扩散模型(LMDM)实现该想法。前者将运动码空间与流图空间桥接,并以扭曲-修复方式合成视频帧。LMDM 通过合成运动码序列学习训练数据中的运动先验。大量定量与定性分析表明,在 TaichiHD、FaceForensics 与 CelebV-HQ 数据集上,LEO 相较先前方法显著改善了人体视频的一致性合成。此外,LEO 中外观与运动的有效解耦支持两项额外任务,即无限长度人体视频合成以及内容保持的视频编辑。

关键词

引用

@article{arxiv.2305.03989,
  title  = {LEO: Generative Latent Image Animator for Human Video Synthesis},
  author = {Yaohui Wang and Xin Ma and Xinyuan Chen and Cunjian Chen and Antitza Dantcheva and Bo Dai and Yu Qiao},
  journal= {arXiv preprint arXiv:2305.03989},
  year   = {2024}
}

备注

IJCV 2024, Project webpage: https://wyhsirius.github.io/LEO-project/