中文

基于一步扩散的实时表情肖像视频生成

计算机视觉与模式识别 2024-12-19 v1

摘要

潜在扩散模型在从单张参考图像和音频输入生成具有准确唇形同步和自然运动的表情肖像视频方面取得了巨大进展。然而,这些模型远未达到实时,通常需要许多采样步骤,生成一秒钟视频就需要几分钟——这严重限制了实际应用。我们引入了OSA-LCM(一步式化身潜在一致性模型),为基于扩散的实时化身铺平了道路。我们的方法在视频质量上与现有方法相当,但仅需一个采样步骤,速度提高了10倍以上。为了实现这一点,我们提出了一种新颖的化身判别器设计,用于引导唇音一致性和运动表现力,从而在有限的采样步骤中提升视频质量。此外,我们采用了一种基于编辑微调方法(EFT)的第二阶段训练架构,在训练期间将视频生成转化为编辑任务,有效解决了单步生成中的时间间隙挑战。实验表明,OSA-LCM在性能上优于现有的开源肖像视频生成模型,同时以单个采样步骤更高效地运行。

关键词

引用

@article{arxiv.2412.13479,
  title  = {Real-time One-Step Diffusion-based Expressive Portrait Videos Generation},
  author = {Hanzhong Guo and Hongwei Yi and Daquan Zhou and Alexander William Bergman and Michael Lingelbach and Yizhou Yu},
  journal= {arXiv preprint arXiv:2412.13479},
  year   = {2024}
}

备注

14 pages