CorrTalk:面向三维动画的分层语音与面部活动方差间的相关性
计算机视觉与模式识别
2023-10-18 v1 计算几何
摘要
语音驱动的三维面部动画是一项具有挑战性的跨模态任务,已引起日益增长的研究兴趣。在说话活动中,嘴部表现出强烈运动,而其他面部区域通常表现出相对较弱的活动水平。现有方法常通过直接将单层级语音特征映射到整个面部动画来简化过程,忽视了面部活动强度的差异,导致面部运动过度平滑。在本研究中,我们提出一种新颖框架CorrTalk,有效建立分层语音特征与不同区域不同强度面部活动之间的时间相关性。我们定义了一种新颖的面部活动强度度量,通过计算机部顶点位移的短时傅里叶变换来区分强与弱面部活动。基于面部活动的方差,我们提出双分支解码框架以同步合成强与弱面部活动,从而保证更广强度的面部动画合成。此外,提出加权分层特征编码器以建立分层语音特征与不同强度面部活动间的时间相关性,确保唇形同步与可信面部表情。大量定性、定量实验及用户研究表明,我们的CorrTalk优于现有最先进方法。源代码与补充视频公开于:https://zjchu.github.io/projects/CorrTalk/
引用
@article{arxiv.2310.11295,
title = {CorrTalk: Correlation Between Hierarchical Speech and Facial Activity Variances for 3D Animation},
author = {Zhaojie Chu and Kailing Guo and Xiaofen Xing and Yilin Lan and Bolun Cai and Xiangmin Xu},
journal= {arXiv preprint arXiv:2310.11295},
year = {2023}
}