中文

PTalker:基于风格解缔与模态对齐的个性化语音驱动3D说话人头部动画

计算机视觉与模式识别 2025-12-30 v1

摘要

语音驱动的3D说话人头部生成旨在产生与语音精确同步的逼真面部动画。虽然已为实现高 lip-synchronization 准确性取得了显著进展,但现有方法大体忽视了个体说话风格的细微差异,这限制了个性化和真实性。本文提出一种新型框架,用于个性化3D说话人头部动画,称为"PTalker"。该框架通过从音频和面部运动序列中解缔风格来保留说话风格,通过三级对齐机制增强语音与网格模态之间的 lip-synchronization 准确性。具体而言,为有效解缔风格与内容, 我们设计了解缔约束,将驱动音频和运动序列编码到不同的风格和内容空间,以增强说话风格表征。为提高 lip-synchronization 准确性,我们采用包含三个方面的模态对齐机制:针对3D网格结构中顶点连通性使用图注意力网络进行空间对齐,采用跨注意力捕获和同步时序依赖性进行时序对齐,采用 Top-k 双向对比损失和 KL 散度约束确保语音与网格模态之间的一致性。在公共数据集上进行大量定性和定量实验表明,PTalker 有效生成与身份特定说话风格相匹配的逼真、带风格的3D说话人头部,超越了最新方法。源代码和补充视频均可用于 PTalker。

关键词

引用

@article{arxiv.2512.22602,
  title  = {PTalker: Personalized Speech-Driven 3D Talking Head Animation via Style Disentanglement and Modality Alignment},
  author = {Bin Wang and Yang Xu and Huan Zhao and Hao Zhang and Zixing Zhang},
  journal= {arXiv preprint arXiv:2512.22602},
  year   = {2025}
}