中文

面向细粒度可控说话头合成的解耦表示渐进学习

计算机视觉与模式识别 2022-11-29 v1

摘要

我们提出了一种新颖的一次性说话头合成方法,可实现对唇部运动、目光与眨眼、头部姿态以及情感表达的细粒度解耦控制。我们通过解耦的隐表示来表征不同运动,并利用图像生成器从中合成说话头。为有效解耦各运动因子,我们提出一种由粗到细的渐进解耦表示学习策略,即先从驱动信号中提取统一运动特征,再从统一特征中分离出各细粒度运动。针对非情感运动,我们引入运动特定的对比学习与回归;针对情感表达,我们采用特征级去相关与自重建,以充分利用非结构化视频数据中各运动因子的固有属性来实现解耦。实验表明,我们的方法能提供高质量的语音与唇动同步,并对多种额外面部运动实现精确且解耦的控制,这是以往方法难以实现的。

关键词

引用

@article{arxiv.2211.14506,
  title  = {Progressive Disentangled Representation Learning for Fine-Grained Controllable Talking Head Synthesis},
  author = {Duomin Wang and Yu Deng and Zixin Yin and Heung-Yeung Shum and Baoyuan Wang},
  journal= {arXiv preprint arXiv:2211.14506},
  year   = {2022}
}

备注

18 pages