中文

DAE-Talker:基于扩散自编码器的高保真语音驱动说话人脸生成

计算机视觉与模式识别 2025-04-08 v7 多媒体

摘要

尽管近期研究在语音驱动说话人脸生成方面取得了显著进展,生成视频的质量仍落后于真实录制视频。原因之一在于使用了基于人类知识设计、不足以精确描述面部运动的手工中间表示,如面部标志点与 3DMM 系数。此外,这些方法需要外部预训练模型来提取这些表示,其性能为说话人脸生成设定了上限。为应对这些局限,我们提出一种称为 DAE-Talker 的新方法,其利用从扩散自编码器(DAE)获得的数据驱动隐表示。DAE 包含一个将图像编码为隐向量的图像编码器,以及一个从隐向量重建图像的 DDIM 图像解码器。我们在说话人脸视频帧上训练 DAE,然后提取其隐表示作为基于 Conformer 的 speech2latent 模型的训练目标。这使得 DAE-Talker 能够合成完整视频帧并生成与语音内容对齐的自然头部运动,而非依赖于模板视频中预定的头部姿态。我们还在 speech2latent 中引入姿态建模以实现姿态可控性。此外,我们提出一种利用在单帧上训练的 DDIM 图像解码器生成连续视频帧的新方法,无需直接建模连续帧的联合分布。我们的实验表明,DAE-Talker 在唇形同步、视频保真度与姿态自然度上优于现有流行方法。我们还进行了消融研究以分析所提技术的有效性,并展示了 DAE-Talker 的姿态可控性。

关键词

引用

@article{arxiv.2303.17550,
  title  = {DAE-Talker: High Fidelity Speech-Driven Talking Face Generation with Diffusion Autoencoder},
  author = {Chenpeng Du and Qi Chen and Tianyu He and Xu Tan and Xie Chen and Kai Yu and Sheng Zhao and Jiang Bian},
  journal= {arXiv preprint arXiv:2303.17550},
  year   = {2025}
}

备注

Accepted to ACM Multimedia 2023