PointTalk:基于 3D 高斯的音频驱动动态唇部点云说话人头肖像合成
声音
2024-12-12 v1 人工智能
图形学
多媒体
音频与语音处理
摘要
基于任意语音音频的说话人头肖像合成是数字人类领域的关键挑战。最近,基于辐射场的方法因能够仅通过几分钟的训练视频即可合成高保真且身份一致的说话人头肖像而受到 increased attention。然而,由于训练数据的受限规模,这些方法往往在音频-唇部同步性和视觉质量方面表现不佳。本文提出了一种名为 PointTalk 的新型 3D 高斯方法,该方法构建说话人头部的静态 3D 高斯场,并同步变形以适应音频。它还集成了音频驱动的动态唇部点云作为条件信息的关键组件,从而促进说话人头肖像的有效合成。具体而言,初始步骤涉及从音频信号生成相应的唇部点云并捕获其拓扑结构。动态差分编码器的设计旨在更有效地捕捉动态唇部运动中所蕴含的细微细节。此外,我们集成了音频-点增强模块,不仅确保音频信号与相应唇部点云在特征空间中的同步,还促进对跨模态条件特征之间关系的深入理解。广泛的实验表明,我们的方法在说话人头肖像合成中在高保真度和音频-唇部同步性方面优于先前方法。
引用
@article{arxiv.2412.08504,
title = {PointTalk: Audio-Driven Dynamic Lip Point Cloud for 3D Gaussian-based Talking Head Synthesis},
author = {Yifan Xie and Tao Feng and Xin Zhang and Xiangyang Luo and Zixuan Guo and Weijiang Yu and Heng Chang and Fei Ma and Fei Richard Yu},
journal= {arXiv preprint arXiv:2412.08504},
year = {2024}
}
备注
9 pages, accepted by AAAI 2025