中文

EDTalk++:用于可控说话人合成的完全解耦

计算机视觉与模式识别 2025-08-20 v1

摘要

实现对多种面部动作的解耦控制,并适应多样化的输入模态,显著提升了说话人生成的应用前景和娱乐价值。这要求深入探索面部特征的解耦空间,确保它们 a) 在不受相互干扰的情况下独立工作, b) 能够与不同模态输入共享保存,这两个方面往往被现有方法所忽视。为此,本文提出一种名为 EDTalk++ 的新型说话人生成的全面解耦框架。我们的框架允许针对视频或音频输入单独操控嘴部形状、头部姿态、眼部动作和情绪表情。具体而言,我们采用四个轻量级模块将面部动态分解为四个互不相同的潜空间,分别表示嘴部、姿态、眼部和表情。每个空间由一组可学习的基数组成,其线性组合定义特定的动作。为确保各空间的独立性并加速训练,我们在基数组之间强制正交性,并设计了一种高效训练策略,将运动责任分配给每个空间,而无需依赖外部知识。学习得到的基数组被存储在相应的银行中,从而实现与音频输入的视觉先验共享。此外,考虑到每个空间的特性,我们提出了一个 Audio-to-Motion 模块,用于音频驱动的说话人合成。我们在实验中验证了 EDTalk++ 的有效性。

关键词

引用

@article{arxiv.2508.13442,
  title  = {EDTalk++: Full Disentanglement for Controllable Talking Head Synthesis},
  author = {Shuai Tan and Bin Ji},
  journal= {arXiv preprint arXiv:2508.13442},
  year   = {2025}
}

备注

17 pages,15 figures. arXiv admin note: substantial text overlap with arXiv:2404.01647