中文

AI 终结了视频星辰:面向表达性说话人生成的音频驱动扩散模型

计算机视觉与模式识别 2025-12-01 v1

摘要

我们提出 Dimitra++,一个新颖的框架,用于音频驱动的说话人生成,旨在学习唇部动作、面部表情以及头部姿态动作。具体而言,我们提出了条件运动扩散变换器(cMDT)来建模面部运动序列,采用三维表示。cMDT 依赖于两个输入:一个参考面部图像,用于确定外观,以及一个音频序列,用于驱动运动。定量和定性实验,以及在 VoxCeleb2 和 CelebV-HQ 两个广泛使用的数据集上的用户研究结果表明,Dimitra++ 能够在生成逼真的说话人方面超过现有方法,实现唇部动作、面部表情和头部姿态的综合生成。

关键词

引用

@article{arxiv.2511.22488,
  title  = {AI killed the video star. Audio-driven diffusion model for expressive talking head generation},
  author = {Baptiste Chopin and Tashvik Dhamija and Pranav Balaji and Yaohui Wang and Antitza Dantcheva},
  journal= {arXiv preprint arXiv:2511.22488},
  year   = {2025}
}

备注

arXiv admin note: text overlap with arXiv:2502.17198