基于视频的视觉语音感知三维面部表情感知重建
计算机视觉与模式识别
2022-07-25 v1
摘要
得益于深度学习的出现,近期基于单目图像数据的单目三维人脸重建技术取得了令人印象深刻的进展。然而,它主要聚焦于来自单张 RGB 图像的输入,忽视了以下重要因素:a) 如今,绝大多数感兴趣的面部图像数据并非来自单张图像,而是来自包含丰富动态信息的视频。b) 此外,这些视频通常捕捉处于某种言语交流中的个体(公开演讲、远程会议、音视频人机交互、访谈、电影中的独白/对话等)。当现有三维人脸重建方法应用于此类视频时,嘴部区域形状和运动重建中的伪影通常很严重,因为它们与语音音频匹配不佳。为克服上述局限,我们提出了首个用于三维嘴部表情的视觉语音感知感知重建的方法。为此我们提出一种“唇读”损失,引导拟合过程使得从三维重建说话头中引发的感知与原始视频画面相似。我们证明,有趣的是,相比于传统 landmark 损失甚至直接三维监督,唇读损失更适用于嘴部运动的三维重建。此外,所设计的方法不依赖于任何文本转写或相应音频,使其非常适合在无标签数据集上训练。我们通过三个大规模数据集上的详尽客观评估以及两项基于网络的用户研究主观评估验证了方法的效率。
引用
@article{arxiv.2207.11094,
title = {Visual Speech-Aware Perceptual 3D Facial Expression Reconstruction from Videos},
author = {Panagiotis P. Filntisis and George Retsinas and Foivos Paraperas-Papantoniou and Athanasios Katsamanis and Anastasios Roussos and Petros Maragos},
journal= {arXiv preprint arXiv:2207.11094},
year = {2022}
}