Talk3D: 通过个性化3D生成先验的高保真说话人肖像合成
计算机视觉与模式识别
2024-04-01 v1
摘要
最近的音频驱动说话人头部合成方法通常优化单目说话人肖像视频上的神经辐射场(NeRF),利用其渲染高保真和3D一致的新视角帧的能力。然而,由于输入单目视频中缺乏全面的3D信息,它们通常难以重建完整的面部几何。在本文中,我们引入了一种新颖的音频驱动说话人头部合成框架,称为Talk3D,通过有效采用预训练的3D感知生成先验,能够忠实地重建其合理的面部几何。给定个性化的3D生成模型,我们提出了一种新颖的音频引导注意力U-Net架构,该架构预测由音频驱动的NeRF空间中的动态面部变化。此外,我们的模型进一步由与音频无关的条件令牌调制,这些令牌有效地解耦了与音频特征无关的变化。与现有方法相比,我们的方法即使在极端头部姿态下也能生成逼真的面部几何。我们还进行了大量实验,表明我们的方法在定量和定性评估方面均超越了最先进的基准。
引用
@article{arxiv.2403.20153,
title = {Talk3D: High-Fidelity Talking Portrait Synthesis via Personalized 3D Generative Prior},
author = {Jaehoon Ko and Kyusun Cho and Joungbin Lee and Heeji Yoon and Sangmin Lee and Sangjun Ahn and Seungryong Kim},
journal= {arXiv preprint arXiv:2403.20153},
year = {2024}
}
备注
Project page: https://ku-cvlab.github.io/Talk3D/