中文

DisentTalk:基于语义解缠分扩散模型的跨语言说话人脸生成

计算机视觉与模式识别 2025-03-26 v1 人工智能

摘要

近期的说话人脸生成技术显著提升了面部动画合成效果。然而,现有方法面临根本性限制:3DMM 方法保持时间一致性但缺乏细粒度区域控制,而基于 Stable Diffusion 的方法实现了空间操作但 suffer 从时间一致性。这种方法的集成受到不兼容的控制机制和面部表示语义缠分的阻碍。本文提出了 DisentTalk,引入一种数据驱动的语义解缠分框架,将 3DMM 表情参数分解为有意义的子空间,以实现细粒度的面部控制。基于该解缠分表示,我们开发了在 3DMM 参数空间中运行的层次化潜在扩散架构,集成区域感知注意力机制以确保空间精度和时间一致性。为解决中文高质量训练数据匮乏的问题,我们引入了 CHDTF,即中文高清说话人脸数据集。广泛的实验表明,DisentTalk 在多个指标上优于现有方法,包括唇部同步、表情质量和时间一致性。项目页面:https://kangweiiliu.github.io/DisentTalk。

关键词

引用

@article{arxiv.2503.19001,
  title  = {DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model},
  author = {Kangwei Liu and Junwu Liu and Yun Cao and Jinlin Guo and Xiaowei Yi},
  journal= {arXiv preprint arXiv:2503.19001},
  year   = {2025}
}