中文

DiffTalker:基于中间 landmarks 的音频-图像协同驱动扩散说话人脸生成

计算机视觉与模式识别 2023-09-15 v1

摘要

生成逼真的说话人脸是一项复杂且被广泛讨论的任务,具有众多应用。本文提出DiffTalker,一种通过音频与landmark协同驱动生成生动说话人脸的新模型。DiffTalker解决了将扩散模型直接应用于音频控制所面临的挑战,此类模型传统上基于文本-图像对训练。DiffTalker由两个代理网络组成:基于transformer的landmark补全网络用于几何精度,以及基于扩散的人脸生成网络用于纹理细节。Landmark在建立音频与图像域之间无缝连接方面起关键作用,促进预训练扩散模型知识的引入。这一创新方法高效生成口齿清晰的说话人脸。实验结果展示了DiffTalker在生成清晰且几何准确的说话人脸方面的优越性能,且无需音频与图像特征间的额外对齐。

关键词

引用

@article{arxiv.2309.07509,
  title  = {DiffTalker: Co-driven audio-image diffusion for talking faces via intermediate landmarks},
  author = {Zipeng Qi and Xulong Zhang and Ning Cheng and Jing Xiao and Jianzong Wang},
  journal= {arXiv preprint arXiv:2309.07509},
  year   = {2023}
}

备注

submmit to ICASSP 2024