NeRF-AD:基于注意力解耦的神经辐射场用于说话人脸合成
计算机视觉与模式识别
2024-05-17 v1 多媒体
摘要
由音频驱动的说话人脸合成是当前多维信号处理和多媒体领域的研究热点之一。神经辐射场 (NeRF) 最近被引入该研究领域,以增强生成人脸的真实感和 3D 效果。然而,大多数现有的基于 NeRF 的方法要么让 NeRF 承担复杂的学习任务,同时缺乏监督多模态特征融合的方法,要么无法将音频精确映射到与言语运动相关的面部区域。这些原因最终导致现有方法生成不准确的唇形。本文将一部分 NeRF 学习任务前置,提出了一种通过带有基于注意力解耦的 NeRF (NeRF-AD) 的说话人脸合成方法。特别地,引入了一个基于注意力的解耦模块,利用与语音相关的面部动作单元 (AU) 信息将人脸解耦为音频人脸和身份人脸。为了精确调控音频如何影响说话人脸,我们仅将音频人脸与音频特征融合。此外,AU 信息也被用来监督这两种模态的融合。大量的定性和定量实验表明,我们的 NeRF-AD 在生成逼真的说话人脸视频方面,包括图像质量和唇音同步,优于最先进的方法。要查看视频结果,请参阅 https://xiaoxingliu02.github.io/NeRF-AD。
引用
@article{arxiv.2401.12568,
title = {NeRF-AD: Neural Radiance Field with Attention-based Disentanglement for Talking Face Synthesis},
author = {Chongke Bi and Xiaoxing Liu and Zhilei Liu},
journal= {arXiv preprint arXiv:2401.12568},
year = {2024}
}
备注
Accepted by ICASSP 2024