DisentTalk:基于语义解缠分扩散模型的跨语言说话人脸生成
计算机视觉与模式识别
2025-03-26 v1 人工智能
摘要
近期的说话人脸生成技术显著提升了面部动画合成效果。然而,现有方法面临根本性限制:3DMM 方法保持时间一致性但缺乏细粒度区域控制,而基于 Stable Diffusion 的方法实现了空间操作但 suffer 从时间一致性。这种方法的集成受到不兼容的控制机制和面部表示语义缠分的阻碍。本文提出了 DisentTalk,引入一种数据驱动的语义解缠分框架,将 3DMM 表情参数分解为有意义的子空间,以实现细粒度的面部控制。基于该解缠分表示,我们开发了在 3DMM 参数空间中运行的层次化潜在扩散架构,集成区域感知注意力机制以确保空间精度和时间一致性。为解决中文高质量训练数据匮乏的问题,我们引入了 CHDTF,即中文高清说话人脸数据集。广泛的实验表明,DisentTalk 在多个指标上优于现有方法,包括唇部同步、表情质量和时间一致性。项目页面:https://kangweiiliu.github.io/DisentTalk。
引用
@article{arxiv.2503.19001,
title = {DisentTalk: Cross-lingual Talking Face Generation via Semantic Disentangled Diffusion Model},
author = {Kangwei Liu and Junwu Liu and Yun Cao and Jinlin Guo and Xiaowei Yi},
journal= {arXiv preprint arXiv:2503.19001},
year = {2025}
}