S^3D-NeRF:面向高保真说话人头合成的单射语音驱动神经射线场
计算机视觉与模式识别
2024-08-20 v1
摘要
说话人头合成是一种具有广泛应用的实用技术。当前的神经射线场(NeRF)方法在驱动一句话的说话人头方面显示出优势,但大多数方法未能直接将音频作为驱动信息,无法享受语音的灵活性和可用性。由于将音频信号映射到面部变形具有技术难题,我们在本文中设计了单射语音驱动神经射线场(S^3D-NeRF)方法以解决以下三个难题:为每个身份学习代表性的外观特征、建模不同面部区域的运动、保持唇部区域的时间一致性。为此,我们引入了分层面部外观编码器以学习捕获不同说话人外观的多尺度表示,详述了跨模态面部变形场以根据音频信号与不同面部区域之间的关系进行语音动画。此外,为增强重要唇部区域的时间一致性,我们引入了唱歌-判别器以惩罚不同步的音视频序列。大量实验表明,我们的 S^3D-NeRF 在视频保真度和音频-唇同步方面超越了前人。
引用
@article{arxiv.2408.09347,
title = {S^3D-NeRF: Single-Shot Speech-Driven Neural Radiance Field for High Fidelity Talking Head Synthesis},
author = {Dongze Li and Kang Zhao and Wei Wang and Yifeng Ma and Bo Peng and Yingya Zhang and Jing Dong},
journal= {arXiv preprint arXiv:2408.09347},
year = {2024}
}
备注
ECCV 2024