中文

MMFace4D:用于音频驱动三维人脸动画的大规模多模态四维人脸数据集

计算机视觉与模式识别 2023-12-14 v2

摘要

音频驱动人脸动画是 VR/AR、游戏和电影制作等应用中备受期待的技术。随着三维引擎的快速发展,用音频驱动三维人脸的需求日益增长。然而,当前可用的三维人脸动画数据集要么规模有限,要么质量不佳,阻碍了音频驱动三维人脸动画的进一步发展。为应对这一挑战,我们提出了 MMFace4D,一个大规模多模态四维(三维序列)人脸数据集,包含 431 个身份、35,904 条序列和 390 万帧。MMFace4D 具有两个引人注目的特点:1) 极其多样的受试者和语料,涵盖年龄 15 至 68 岁的演员,以及时长 0.7 至 11.4 秒的录制句子。2) 它具有高分辨率人脸细节的同步音频和三维网格序列。为捕捉三维面部表情的细微差别,我们在录制过程中使用了三个同步的 RGBD 相机。基于 MMFace4D,我们构建了一个用于音频驱动三维人脸动画的非自回归框架。我们的框架考虑了面部动画的区域性和复合性,在定性和定量上均超越了当前的 SOTA 方法。代码、模型和数据集将公开可用。

关键词

引用

@article{arxiv.2303.09797,
  title  = {MMFace4D: A Large-Scale Multi-Modal 4D Face Dataset for Audio-Driven 3D Face Animation},
  author = {Haozhe Wu and Jia Jia and Junliang Xing and Hongwei Xu and Xiangyuan Wang and Jelo Wang},
  journal= {arXiv preprint arXiv:2303.09797},
  year   = {2023}
}

备注

10 pages, 8 figures. This paper has been submitted to IEEE Transaction on MultiMedia, which is the extension of our MM2023 paper arXiv:2308.05428. The dataset is now publicly available, see Project page at https://wuhaozhe.github.io/mmface4d/