DFA-NeRF:基于解耦人脸属性神经渲染的个性化说话头生成
计算机视觉与模式识别
2022-01-04 v1
摘要
尽管深度神经网络的最新进展已使高质量图像渲染成为可能,生成照片级真实且个性化的说话头仍具挑战性。在给定音频的情况下,解决该任务的关键在于同步唇部运动并同时生成头部运动与眨眼等个性化属性。本工作中,我们观察到输入音频与唇部运动高度相关,而与其他个性化属性(如头部运动)相关性较弱。受此启发,我们提出一种基于神经辐射场的新型框架,以追求高保真且个性化的说话头生成。具体而言,神经辐射场将唇部运动特征与个性化属性作为两个解耦条件,其中唇部运动由音频输入直接预测以实现唇同步生成。同时,个性化属性从概率模型中采样,我们设计了一个基于 Transformer 的变分自编码器从高斯过程采样,以学习合理且自然的头部姿态与眨眼。在多个基准上的实验表明,我们的方法取得了显著优于最先进方法的结果。
引用
@article{arxiv.2201.00791,
title = {DFA-NeRF: Personalized Talking Head Generation via Disentangled Face Attributes Neural Rendering},
author = {Shunyu Yao and RuiZhe Zhong and Yichao Yan and Guangtao Zhai and Xiaokang Yang},
journal= {arXiv preprint arXiv:2201.00791},
year = {2022}
}