中文

肖像视频生成的自监督运动表示

计算机视觉与模式识别 2025-06-16 v2

摘要

肖像视频生成领域的最新进展值得关注。然而,现有方法严重依赖人类先验和预训练生成模型;基于人类先验的运动表示可能引入不真实的运动,而依赖预训练生成模型的方法通常面临推理效率低下。为应对这些挑战,我们提出了语义潜在运动(Semantic Latent Motion, SeMo),一种紧凑且表达力强的运动表示。利用该表示,我们的方法同时实现了高质量的视觉结果和高效的推理。SeMo遵循一个有效的三步框架:抽象、推理和生成。首先,在抽象步骤中,我们使用精心设计的掩码运动编码器,利用自监督学习范式将主体的运动状态压缩为紧凑且抽象的潜在运动(1D token)。其次,在推理步骤中,我们基于驱动音频信号高效生成运动序列。最后,在生成步骤中,运动动力学作为条件信息引导运动解码器,从参考帧合成到目标视频的真实过渡。由于语义潜在运动的紧凑性和表达力,我们的方法实现了高效的运动表示和高质量的视频生成。用户研究表明,我们的方法在真实感方面以81%的胜率超越了最先进模型。大量实验进一步突显了其强大的压缩能力、重构质量和生成潜力。

关键词

引用

@article{arxiv.2503.10096,
  title  = {A Self-supervised Motion Representation for Portrait Video Generation},
  author = {Qiyuan Zhang and Chenyu Wu and Wenzhang Sun and Huaize Liu and Donglin Di and Wei Chen and Changqing Zou},
  journal= {arXiv preprint arXiv:2503.10096},
  year   = {2025}
}