R2-Talker:基于哈希网格关键点编码与渐进式多层条件化的逼真实时说话人头合成
计算机视觉与模式识别
2023-12-12 v1
摘要
动态 NeRF 近期在 3D 说话人像合成中引起了越来越多的关注。尽管在渲染速度和视觉质量方面取得了进展,但在提升效率和有效性方面仍存在挑战。我们提出了 R2-Talker,这是一个能够实现逼真实时说话人头合成的高效且有效的框架。具体而言,我们利用多分辨率哈希网格,引入了一种将面部关键点编码为条件特征的新方法。该方法将关键点结构无损地编码为条件特征,通过将任意关键点映射到统一的特征空间,实现了输入多样性与条件空间的解耦。我们进一步在 NeRF 渲染管线中提出了一种渐进式多层条件化方案,以实现有效的条件特征融合。大量实验表明,与最先进的工作相比,我们的新方法具有以下优势:1)无损输入编码能够获取更精确的特征,产生更优的视觉质量。输入与条件空间的解耦提高了泛化能力。2)在每个 MLP 层融合条件特征与 MLP 输出增强了条件影响,从而实现更准确的唇部合成和更好的视觉质量。3)它紧凑地构建了条件特征的融合,显著提升了计算效率。
引用
@article{arxiv.2312.05572,
title = {R2-Talker: Realistic Real-Time Talking Head Synthesis with Hash Grid Landmarks Encoding and Progressive Multilayer Conditioning},
author = {Zhiling Ye and LiangGuo Zhang and Dingheng Zeng and Quan Lu and Ning Jiang},
journal= {arXiv preprint arXiv:2312.05572},
year = {2023}
}