中文

LSF-Animation:基于隐式特征表示的无标签语音驱动面部动画

计算机视觉与模式识别 2025-10-28 v1 图形学

摘要

由于其生成具有表现力且时间上与之同步的数字人类的潜力,语音驱动的3D面部动画吸引了越来越多的关注。虽然最近的工作开始探索情感感知动画,但仍依赖于显式的独热编码来表示身份和情感,需要给定的情感和身份标签,这限制了其对未见身份说话者的泛化能力。此外,语音中固有的情感线索往往被忽略,这限制了生成动画的自然性和可适应性。本文提出了LSF-Animation,一种新型框架,消除对显式情感和身份特征表示的依赖。具体而言,LSF-Animation从语音中隐式地提取情感信息,并从中性面部网格中捕获身份特征,从而在无需手动标签的情况下提高了对未见身份说话者和情感状态的泛化能力。进一步地,我们引入了层次化交互融合块(HIFB),该模块利用融合标记整合双transformer特征,更有效地整合情感、运动相关和身份相关线索。在3DMEAD数据集上进行的大量实验表明,我们的方法在情感表达性、身份泛化性和动画真实性方面均优于最近的前沿方法。源代码将在 https://github.com/Dogter521/LSF-Animation 发布。

关键词

引用

@article{arxiv.2510.21864,
  title  = {LSF-Animation: Label-Free Speech-Driven Facial Animation via Implicit Feature Representation},
  author = {Xin Lu and Chuanqing Zhuang and Chenxi Jin and Zhengda Lu and Yiqun Wang and Wu Liu and Jun Xiao},
  journal= {arXiv preprint arXiv:2510.21864},
  year   = {2025}
}