中文

DAWN:基于非自回归扩散框架的动态帧头像生成

计算机视觉与模式识别 2025-03-27 v3 人工智能

摘要

说话人脸生成旨在从单个肖像和语音音频片段生成逼真且生动的说话人视频。尽管扩散方法在说话人生成领域取得了显著进展,但几乎所有方法都依赖自回归策略,导致无法充分利用当前生成步骤之外的上下文、出现误差累积且生成速度较慢。为此,我们提出DAWN(Dynamic frame Avatar With Non-autoregressive diffusion),一个实现动态长度视频序列全流程生成的框架。具体包括两个主要组件:(1)基于音频驱动的整体面部动态生成(潜在运动空间中),以及(2)基于音频驱动的头部姿态与眨眼生成。大量实验表明,我们的方法可生成逼真的视频,精准表现唇形动作,呈现自然的姿态和眨眼动作。此外,DAWN具备高速生成能力,具有强大的外推能力,确保能稳定产出高质量的长视频。这些结果凸显了DAWN在说话人视频生成领域的巨大潜力与应用前景。我们也希望DAWN能激发非自回归扩散模型方法的进一步探索。代码将公开于https://github.com/Hanbo-Cheng/DAWN-pytorch。

关键词

引用

@article{arxiv.2410.13726,
  title  = {DAWN: Dynamic Frame Avatar with Non-autoregressive Diffusion Framework for Talking Head Video Generation},
  author = {Hanbo Cheng and Limin Lin and Chenyu Liu and Pengcheng Xia and Pengfei Hu and Jiefeng Ma and Jun Du and Jia Pan},
  journal= {arXiv preprint arXiv:2410.13726},
  year   = {2025}
}