中文

Learn2Talk:三维说话人脸从二维说话人脸学习

计算机视觉与模式识别 2024-04-22 v1 图形学 机器学习

摘要

语音驱动的面部动画方法通常包含两大类:三维和二维说话人脸,两者近年来都引起了广泛的研究关注。然而,据我们所知,在唇形同步和语音感知方面,三维说话人脸的研究不如二维说话人脸深入。为了弥补这两个子领域之间的差距,我们提出了一种名为 Learn2Talk 的学习框架,该框架通过利用二维说话人脸领域的两个专长点来构建更好的三维说话人脸网络。首先,受音视频同步网络启发,设计了一个三维唇形同步专家模型,以追求音频与三维面部动作之间的唇形同步。其次,从二维说话人脸方法中选取的教师模型用于指导音频到三维动作回归网络的训练,以产生更高的三维顶点精度。大量实验表明,与 SOTA 方法相比,所提框架在唇形同步、顶点精度和语音感知方面具有优势。最后,我们展示了所提框架的两个应用:视听语音识别和语音驱动的基于 3D Gaussian Splatting 的虚拟人动画。

关键词

引用

@article{arxiv.2404.12888,
  title  = {Learn2Talk: 3D Talking Face Learns from 2D Talking Face},
  author = {Yixiang Zhuang and Baoping Cheng and Yao Cheng and Yuntao Jin and Renshuai Liu and Chengyang Li and Xuan Cheng and Jing Liao and Juncong Lin},
  journal= {arXiv preprint arXiv:2404.12888},
  year   = {2024}
}