中文

AVFace:面向精细音视频4D人脸重建

计算机视觉与模式识别 2023-05-15 v2

摘要

在本工作中,我们提出一种从单目视频进行4D人脸重建的多模态解决方案。从2D图像进行3D人脸重建由于深度的模糊性是一个欠约束问题。现有最优方法试图利用单幅图像或视频的视觉信息来解决该问题,而3D网格动画方法更多依赖音频。然而,在大多数情况下(如AR/VR应用),视频同时包含视觉和语音信息。我们提出AVFace,它融合两种模态并精确重建任意说话人的4D面部与嘴唇运动,且训练时无需任何3D真值。一个粗阶段估计3D可变形模型的逐帧参数,随后进行嘴唇细化,再由一个精细阶段恢复面部几何细节。由于基于transformer的模块捕获了时序音频与视频信息,我们的方法在任一模态不充分(如面部遮挡)时仍具鲁棒性。大量定性与定量评估证明了我们的方法优于当前最优方法。

关键词

引用

@article{arxiv.2304.13115,
  title  = {AVFace: Towards Detailed Audio-Visual 4D Face Reconstruction},
  author = {Aggelina Chatziagapi and Dimitris Samaras},
  journal= {arXiv preprint arXiv:2304.13115},
  year   = {2023}
}

备注

Accepted by CVPR 2023. Project page: https://aggelinacha.github.io/AVFace/