中文

EDTalk: 高效解耦用于情感说话头合成

计算机视觉与模式识别 2024-04-03 v1

摘要

实现对多个面部运动的解耦控制并适应多样化的输入模态,极大地增强了说话头生成的应用和娱乐性。这需要对面部特征的解耦空间进行深入探索,确保它们a) 独立运行而不相互干扰,b) 能够被保留以与不同模态输入共享,这两个方面在现有方法中常常被忽视。为了解决这一差距,本文提出了一种新颖的高效解耦框架用于说话头生成(EDTalk)。我们的框架能够基于视频或音频输入,分别操控嘴型、头部姿态和情感表达。具体来说,我们使用三个轻量级模块将面部动态分解为三个不同的潜在空间,分别代表嘴部、姿态和表情。每个空间由一组可学习基向量表征,其线性组合定义特定的运动。为了确保独立性并加速训练,我们强制基向量之间正交,并设计了一种高效的训练策略,将运动责任分配给每个空间,而不依赖外部知识。学习到的基向量随后存储在相应的库中,从而能够与音频输入共享视觉先验。此外,考虑到每个空间的特性,我们提出了一种音频到运动模块,用于音频驱动的说话头合成。实验证明了EDTalk的有效性。我们建议访问项目网站:https://tanshuai0219.github.io/EDTalk/

关键词

引用

@article{arxiv.2404.01647,
  title  = {EDTalk: Efficient Disentanglement for Emotional Talking Head Synthesis},
  author = {Shuai Tan and Bin Ji and Mengxiao Bi and Ye Pan},
  journal= {arXiv preprint arXiv:2404.01647},
  year   = {2024}
}

备注

22 pages, 15 figures