中文

Dimitra:用于生成富有表现力的说话人头像的音频驱动扩散模型

计算机视觉与模式识别 2025-02-25 v1

摘要

我们提出了 Dimitra,一种用于音频驱动说话人头像生成的新框架,旨在简化对唇部运动、面部表情以及头部姿态运动的学习。具体而言,我们通过使用 3D 表示对面部运动序列进行建模,训练了一个条件运动扩散 Transformer(cMDT)。我们仅使用两个输入信号来对 cMDT 进行条件化:一个音频序列以及一张参考面部图像。通过直接从音频中提取额外特征,Dimitra 能够提升生成视频的质量和真实感。特别是,音素序列有助于提升唇部运动的真实感,而文本转录则有助于提升面部表情和头部姿态的真实感。在两个广泛使用的数据集 VoxCeleb2 和 HDTF 上进行的定量和定性实验表明,Dimitra 在生成具有唇部运动、面部表情和头部姿态的逼真说话人头像方面优于现有方法。

关键词

引用

@article{arxiv.2502.17198,
  title  = {Dimitra: Audio-driven Diffusion model for Expressive Talking Head Generation},
  author = {Baptiste Chopin and Tashvik Dhamija and Pranav Balaji and Yaohui Wang and Antitza Dantcheva},
  journal= {arXiv preprint arXiv:2502.17198},
  year   = {2025}
}

备注

5 pages + 2 pages for supplementary material, 2 figures