中文

StyleSpeaker: 音频增强的细粒度风格建模用于语音驱动的3D面部动画

多媒体 2025-03-14 v1

摘要

语音驱动的3D面部动画具有挑战性,原因在于说话风格的多样性以及3D音视频数据的有限可用性。语音主要决定唇部区域的粗运动趋势,而特定风格决定唇部运动的细节和整体面部表情。先前的作品在风格建模中缺乏细粒度学习,并且没有充分考虑不同语音条件下的风格偏差,从而降低了风格建模的准确性并削弱了对未见说话者的适应能力。为解决这一问题,我们提出了一种新框架StyleSpeaker,它基于说话者特征显式提取说话风格,同时考虑不同语音引起的风格偏差。具体而言,我们利用风格编码器从面部运动中捕获说话者的风格,并根据不同语音条件引发的运动偏好对其进行增强。增强后的风格随后通过风格注入模块集成到粗运动特征中,该模块利用一组风格基元来学习细粒度的风格表示。在整个训练过程中,我们维护这组风格基元,以全面建模整个风格空间。因此,StyleSpeaker对已见说话者具有鲁棒的风格建模能力,并且可以在无需微调的情况下快速适应未见说话者。此外,我们设计了趋势损失和局部对比损失,以改善合成运动与语音之间的同步性。在三个公开数据集上的广泛定性和定量实验表明,我们的方法优于现有的最先进方法。

关键词

引用

@article{arxiv.2503.09852,
  title  = {StyleSpeaker: Audio-Enhanced Fine-Grained Style Modeling for Speech-Driven 3D Facial Animation},
  author = {An Yang and Chenyu Liu and Pengcheng Xia and Jun Du},
  journal= {arXiv preprint arXiv:2503.09852},
  year   = {2025}
}