AE-NeRF:面向少样本说话人头像合成的音频增强神经辐射场
计算机视觉与模式识别
2023-12-19 v1 声音
音频与语音处理
摘要
音频驱动的说话人头像合成是一个极具前景的课题,在数字人、电影制作和虚拟现实中有着广泛的应用。与以往研究相比,近期基于 NeRF 的方法在质量和保真度上展现出了优越性。然而,在少样本说话人头像生成(即每个身份仅有几秒钟说话视频的实用场景)中,出现了两个局限性:1)它们要么没有作为快速收敛面部先验的基础模型,要么在构建先验时忽略了音频的重要性;2)大多数方法忽略了不同面部区域与音频之间的相关程度,例如嘴部与音频相关,而耳部与音频无关。在本文中,我们提出了音频增强神经辐射场(AE-NeRF)来解决上述问题,该方法能够在少样本数据集下生成新说话人的逼真肖像。具体而言,我们在参考方案的特征融合阶段引入了音频感知聚合模块,其权重由参考图像与目标图像之间的音频相似度决定。然后,提出了一种音频对齐的人脸生成策略,利用双 NeRF 框架分别对音频相关和音频无关区域进行建模。大量实验表明,即使在训练集有限或训练迭代次数较少的情况下,AE-NeRF 在图像保真度、音频-唇形同步以及泛化能力上均超越了现有技术(SOTA)。
引用
@article{arxiv.2312.10921,
title = {AE-NeRF: Audio Enhanced Neural Radiance Field for Few Shot Talking Head Synthesis},
author = {Dongze Li and Kang Zhao and Wei Wang and Bo Peng and Yingya Zhang and Jing Dong and Tieniu Tan},
journal= {arXiv preprint arXiv:2312.10921},
year = {2023}
}
备注
Accepted by AAAI 2024