中文

基于复合与区域面部运动的语音驱动三维人脸动画

计算机视觉与模式识别 2023-12-14 v1 多媒体

摘要

语音驱动的三维人脸动画由于人类面部运动固有的复杂性与多变性而面临重大挑战。本文强调了在语音驱动三维人脸动画中同时考虑面部运动的复合性与区域性的重要性。复合性涉及与语音无关的因素如何沿时间维度全局调制语音驱动的面部运动。同时,区域性意指面部运动并非全局相关,而是由空间维度上的局部肌肉驱动。因此,要生成生动的动画,必须同时纳入这两种性质。针对复合性,我们引入了一种自适应调制模块,利用任意面部运动在全局尺度上动态调节跨帧的语音驱动面部运动。为适配区域性,我们的方法确保每一帧面部特征的每个组成部分都聚焦于三维面部的局部空间运动。此外,我们提出了一种非自回归骨干网络,用于将音频转换为三维面部运动,该网络保留了面部运动的高频细节并支持高效推理。综合实验与用户研究表明,我们的方法在定性与定量上均超越了当前的SOTA方法。

关键词

引用

@article{arxiv.2308.05428,
  title  = {Speech-Driven 3D Face Animation with Composite and Regional Facial Movements},
  author = {Haozhe Wu and Songtao Zhou and Jia Jia and Junliang Xing and Qi Wen and Xiang Wen},
  journal= {arXiv preprint arXiv:2308.05428},
  year   = {2023}
}

备注

Accepted by MM 2023, 9 pages, 7 figures. arXiv admin note: text overlap with arXiv:2303.09797